Best-of-N Guidance(BoNG)提出测试时扩散模型对齐方法
基于论文摘要,BoNG 将 Best-of-N 选择嵌入扩散模型的反向去噪过程,引导样本生成至高奖励区域。方法通过当前 Best-of-N 粒子引导其余粒子,在36项实证比较中有29项表现最佳,对 SMC 和 Vanilla BoN 的比较中有80.56%排名第一;多输出实验达到基于样本的引导方法1.3倍的 ImageReward 分数,速度提升1.6倍。
动态展示门槛:AI 前沿与应用 ≥ 65 分,量子方向 ≥ 60 分;已确认精选照常展示。
基于论文摘要,BoNG 将 Best-of-N 选择嵌入扩散模型的反向去噪过程,引导样本生成至高奖励区域。方法通过当前 Best-of-N 粒子引导其余粒子,在36项实证比较中有29项表现最佳,对 SMC 和 Vanilla BoN 的比较中有80.56%排名第一;多输出实验达到基于样本的引导方法1.3倍的 ImageReward 分数,速度提升1.6倍。
KlinikeBench是一个包含333个临床医生编写任务的语言模型评测基准,每个任务提供虚拟患者、临床工具和特定成功标准。基于论文摘要,31个模型和七个模型系列中,表现最佳者任务成功率低于30%,但诊断准确率达到90.7%,显示诊断准确性与完整交互式临床评估之间存在明显差距。研究还比较了对话式问诊与完整病历输入,并提供了代码和数据入口。
TIDE 2.0 是 MIT 许可的模型无关临床笔记去标识引擎,将可替换识别器与密钥化匿名器分为两个阶段,并支持在机构自有硬件上运行。方法用密码学生成替身且不存储关联表,通过按患者保留时间间隔的日期偏移保持纵向分析所需关系。