RoP用路径奖励改进知识图谱问答
热点事件观察中
RoP用路径奖励改进知识图谱问答
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Shengxiang Gao等提出Reward on Path(RoP),仅从答案标签学习问题条件化的关系路径奖励,并在多个知识图谱问答数据集上取得F1至少提升2.6%的结果,同时超过需要LLM精炼监督的方法。 RoP将到达同一答案的路径作为整体学习相对贡献,并单独惩罚检索到非答案实体的路径;随后通过奖励蒸馏传递候选路径偏好,再用GRPO基于自生成路径优化LLM关系路径生成器。相关结论基于arXiv摘要,尚未体现独立复现。
AI 根据报道生成 · 47 分钟前更新
最新进展10月7日 12:00
Reward on Path(RoP)通过学习中间路径奖励提升知识图谱问答F1报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIReward on Path(RoP)通过学习中间路径奖励提升知识图谱问答F1
作者提出Reward on Path(RoP)框架,从答案标签学习问题条件化的路径奖励,以降低知识图谱问答中的路径监督噪声和LLM精炼成本。RoP先通过奖励蒸馏传递候选路径偏好,再用GRPO基于自生成路径进行优化;在多个KGQA数据集上,摘要报告其相较答案监督方法的F1至少提升2.6%,并超过LLM精炼方法。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。