语言模型惊讶度预测中文阅读时长
热点事件观察中
语言模型惊讶度预测中文阅读时长
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Hongao Zhu等人分析14M—1.4B参数、训练于300亿token的Chinese-Pythia模型,发现token级惊讶度可预测普通话中文眼动语料中的首次注视时长、注视时长和总阅读时长,但预测效果依赖语料:GECO-CN中模型越大预测越好,HKP中出现反向扩展,MECO仅在最大规模时如此。 研究提出Shortest Matching Sequence,以对齐眼动语料的词语切分与模型子词分词;针对HKP的结果,模型惊讶度越接近n-gram统计,预测越好,但这只是研究检验的一种解释,不能据单篇语料概括规模规律。
AI 根据报道生成 · 41 分钟前更新
最新进展10月7日 12:00
语言模型惊讶度预测中文阅读时间的系统分析报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AI语言模型惊讶度预测中文阅读时间的系统分析
Hongao Zhu等人分析了语言模型 token-level surprisal 对普通话中文阅读时间的预测能力,并提出 Shortest Matching Sequence(SMS)以对齐眼动语料的词语切分与模型子词分词。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。