arXiv · cs.AI· Yikai Zhao, Saurabh Pandey, Pradeep Kumar Misra·· 6 天前精选
Proxy Confidence:用代理模型 log-probabilities 审计黑盒 LLM Agent
Proxy Confidence: Auditing Black-Box LLM Agents with a Surrogate's Log-Probabilities
arXiv:2610.03894v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Yikai Zhao, Saurabh Pandey, Pradeep Kumar Misra
首次提交:2026-10-03 02:09
研究任务与主要进展
研究提出 Proxy Confidence,用低成本的开放权重代理模型并行读取黑盒 LLM Agent 的工具调用、查询和代码动作,并通过自身 log-probabilities 评估调用可靠性。基于论文摘要,在困难编码任务上,该方法的 AUROC 达到 0.825,高于执行模型自报置信度的 0.598;相对自一致性方法,在近乎确定性的执行模型上提升 0.14 至 0.19,成本为其 1/K。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
本站判断
该研究以开源权重代理模型的 log-probabilities 弥补黑盒 LLM Agent 的置信度缺口,并用生成式似然、整体判定和工具竞争等读出方式区分错误类型。其价值在于以一次并行 prefill 支持实时审查和执行反馈,但当前结论仅来自论文摘要,跨任务泛化、代理模型失配和额外成本仍需检验。本站设想:可在更多工具调用类型与不同代理模型上比较各读出方法的校准性和审查覆盖率。
来源:arXiv · cs.AI · arxiv.org