跳到正文
热点事件观察中

RoP用路径奖励改进知识图谱问答

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Shengxiang Gao等提出Reward on Path(RoP),仅从答案标签学习问题条件化的关系路径奖励,并在多个知识图谱问答数据集上取得F1至少提升2.6%的结果,同时超过需要LLM精炼监督的方法。 RoP将到达同一答案的路径作为整体学习相对贡献,并单独惩罚检索到非答案实体的路径;随后通过奖励蒸馏传递候选路径偏好,再用GRPO基于自生成路径优化LLM关系路径生成器。相关结论基于arXiv摘要,尚未体现独立复现。

AI 根据报道生成 · 47 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    Reward on Path(RoP)通过学习中间路径奖励提升知识图谱问答F1

    作者提出Reward on Path(RoP)框架,从答案标签学习问题条件化的路径奖励,以降低知识图谱问答中的路径监督噪声和LLM精炼成本。RoP先通过奖励蒸馏传递候选路径偏好,再用GRPO基于自生成路径进行优化;在多个KGQA数据集上,摘要报告其相较答案监督方法的F1至少提升2.6%,并超过LLM精炼方法。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。