残差流预测LLM评判位置敏感性
热点事件观察中
残差流预测LLM评判位置敏感性
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Shaik、Villuri和Doboli基于论文摘要报告:用LLM作出评判前的残差流激活,可预测候选答案调换顺序后其评判是否翻转。正则化线性探针在534个JudgeBench样本对上取得0.621—0.850的AUROC,较结合语言化置信度、评判标签logit、回答长度和初始选择的基线高0.062—0.113。 探针在三个Qwen3评判器和Llama-3.1-8B上训练后冻结,在1,802组MT-Bench比较中取得0.685—0.853的AUROC,且未用MT-Bench拟合或重新校准。该方法用于事前识别位置敏感样本,并非纠正评判结果。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
基于残差流激活预测位置敏感LLM评判翻转报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AI基于残差流激活预测位置敏感LLM评判翻转
论文研究了如何利用LLM评判前的残差流激活,预测候选答案呈现顺序变化是否会改变评判结果。基于论文摘要,研究在534个JudgeBench样本对上采用分组交叉验证评估三个Qwen3评判器和Llama-3.1-8B,正则化线性探针的AUROC为.621至.850,较组合基线高.062至.113;在冻结探针后,MT-Bench的1,802组比较中AUROC为.685至.853。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。