arXiv · cs.AI· Zhe Yu, Wenpeng Xing, Yunzhao Wei, Bo Yang, Chen Ye, Gaolei Li, Meng Han·· 1 天前
检索增强语言模型的来源依赖:分层轨迹诊断揭示归因盲点
The Attribution Blind Spot: Layerwise Trajectory Diagnostics for Source Reliance in Retrieval-Augmented Language Models
arXiv:2610.09493v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Zhe Yu, Wenpeng Xing, Yunzhao Wei, Bo Yang, Chen Ye, Gaolei Li, Meng Han
首次提交:2026-10-07 13:47
研究任务与主要进展
研究者提出潜在线轨迹偏移(LTS),通过训练集拟合的第一主成分(PC1)带符号投影,分析检索增强语言模型在知识冲突中的来源选择。摘要报告,状态变化幅度往往更能预测模型选择,而带符号 PC1 更适合作为选择性控制方向;等范数干预可改变来源偏好,同时更好地保留非目标行为。冻结后的方向在所测试的数据集和模型对之间实现迁移,但 OLMo 研究在达到的检测能力下对来源暴露检测结果不确定。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org