Transect:开源长时程LLM Agent评测可观测性分析包
热点事件历史事件
Transect:开源长时程LLM Agent评测可观测性分析包
1 篇报道1 个报道来源3 天前更新
先了解这件事
AI 综述
Toby D. Pilditch、Konstantinos Voudouris、Alexandra Abbas、Cozmin Ududec 提出并开源了 Transect,一个基于 Inspect Scout 的分析包,用于理解长时程 LLM 智能体的运行过程、定位值得调查的行为,并把解释回溯到原始转录。 用户在可复用的 evaluation-family 配置中指定任务上下文和行为词汇,评审模型与分析设置单独提供。Transect 将事件、令牌使用、子智能体活动和模型生成的行为标签组织到统一的轮次时间线上。 作者在一次生成近 1300 万令牌的 AI 研发评估上演示了该流程,把智能体的工作按研究技能分类、子智能体委派与交互、令牌使用划分为行为阶段;综合视图显示工作集中在运营和论文产出上,而作者称持续假设生成阶段的证据较少,他们认为这一阶段是高质量科研产出的必要组成部分。
AI 根据报道生成 · 1 天前更新
最新进展10月7日 12:00
Transect:长时程 LLM 智能体评估的可观测性分析包报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AITransect:长时程 LLM 智能体评估的可观测性分析包
Transect 是研究作者构建的开源分析包,用于理解长时程 LLM 智能体运行过程、定位值得调查的行为,并将解释追溯到原始转录。它基于 Inspect Scout,将事件、令牌使用、子智能体活动和模型生成的行为标签按统一轮次时间线组织;作者在一次 AI 研发评估中处理了近 1300 万令牌,发现工作主要集中于运营和论文产出,而持续假设生成阶段的证据较少。