跳到正文

动态展示门槛:AI 前沿与应用 ≥ 65 分,量子方向 ≥ 60 分;已确认精选照常展示。

今天10月8日周四3 条
  1. arXiv · cs.AI

    Best-of-N Guidance(BoNG)提出测试时扩散模型对齐方法

    基于论文摘要,BoNG 将 Best-of-N 选择嵌入扩散模型的反向去噪过程,引导样本生成至高奖励区域。方法通过当前 Best-of-N 粒子引导其余粒子,在36项实证比较中有29项表现最佳,对 SMC 和 Vanilla BoN 的比较中有80.56%排名第一;多输出实验达到基于样本的引导方法1.3倍的 ImageReward 分数,速度提升1.6倍。

  2. arXiv · cs.AI

    KlinikeBench:评估语言模型在诊断准确性之外的表现

    KlinikeBench是一个包含333个临床医生编写任务的语言模型评测基准,每个任务提供虚拟患者、临床工具和特定成功标准。基于论文摘要,31个模型和七个模型系列中,表现最佳者任务成功率低于30%,但诊断准确率达到90.7%,显示诊断准确性与完整交互式临床评估之间存在明显差距。研究还比较了对话式问诊与完整病历输入,并提供了代码和数据入口。