跳到正文
热点事件观察中

CRD用协作反馈蒸馏小模型推理

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Taehoon Kim、Seunggeun Cho和Dongsu Han提出协作推理蒸馏框架CRD,并报告其4B参数模型CRD-4B在两项数学基准上超过对比基线。该框架让教师模型相互批评,在训练预算约束下通过推理质量优化(RQO)训练学生模型,并融合教师模型的互补能力。 基于论文摘要,CRD-4B使用5万条训练样本,在MATH-500和AIME'25上分别取得97.3%和70.3%;训练数据规模最多比可比模型小12倍。材料未提供独立复现信息。

AI 根据报道生成 · 56 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    CRD通过交叉反馈与一致性筛选实现协作推理蒸馏

    Taehoon Kim、Seunggeun Cho和Dongsu Han提出协作推理蒸馏框架CRD,通过教师模型相互批评、独立于最终答案的逐步逻辑质量评估,以及融合互补能力的一致性步骤拼接训练紧凑型模型。基于论文摘要,CRD-4B在MATH-500上达到97.3%,在AIME'25上达到70.3%,超过对比基线;其训练使用5万条样本,数据规模最多比可比模型小12倍。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。