提出2D-FET-Bench V2评测语言模型FET版图设计
热点事件观察中
提出2D-FET-Bench V2评测语言模型FET版图设计
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Dunzhi Zhou、Chengyu Zhu、Gang Qiu、Caiwen Ding等提出2D-FET-Bench V2基准,用128个基于显微图像薄片轮廓的二维FET版图设计任务评测语言模型Agent,任务涵盖含孔薄片和多薄片情形,每个任务提供文本器件规格与轮廓坐标,并用确定性验证器检查几何与结构要求,另设完整性检查确认轮廓未被改动。 评测覆盖六个模型及七种GPT5.6-Luna工作流配置,每任务尝试五次。结果显示GPT5.6-Luna配合ReAct-3的最佳尝试通过率为62.3%,任务覆盖率为80.5%,五次全部通过率为43.8%。该结果目前仅依据论文摘要。
AI 根据报道生成 · 56 分钟前更新
最新进展10月7日 12:00
2D-FET-Bench V2:评测语言模型Agent从空间推理到二维薄片FET版图设计报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · Materials Science2D-FET-Bench V2:评测语言模型Agent从空间推理到二维薄片FET版图设计
作者提出2D-FET-Bench V2基准,包含128个基于显微图像薄片轮廓的FET版图任务,涵盖含孔薄片和多薄片任务,并以确定性验证器检查几何与结构要求。六个模型及七种GPT5.6-Luna工作流配置中,GPT5.6-Luna配合ReAct-3的最佳尝试通过率为62.3%,任务覆盖率为80.5%,五次尝试全部通过率为43.8%;该结果仅依据论文摘要。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。