跳到正文
热点事件观察中

BitNest以嵌套低精度模型加速大模型推理

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Chence Yang、Ningxi Cheng、Arash Akbari等作者提出BitNest推测解码框架,将低精度草稿模型嵌入高精度目标模型并通过残差细化恢复目标表示,使两者共享单一物理权重。作者称,在多个7B—8B边缘友好型大语言模型及不同工作负载上,平均推测接受率为95.2%,相较FP16自回归解码实现1.48—1.61倍端到端加速,同时保持接近的高精度模型质量。 该框架还将渐进精度设计扩展到长上下文推理的KV缓存;在受所有代表性自推测基线支持的LLaMA模型上,作者报告其解码加速具有竞争力或更高。上述结果仅基于论文摘要。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    BitNest通过位嵌套推测解码实现内存高效的大语言模型推理加速

    BitNest提出一种位嵌套推测解码框架,将低精度草稿模型直接嵌入高精度目标模型,并通过残差细化恢复目标表示,使两者共享单一物理权重表示。该框架还扩展到KV缓存;在多个7B--8B边缘友好型大语言模型和不同工作负载上,作者报告平均推测接受率为95.2%,相较FP16自回归解码实现1.48--1.61倍端到端加速,同时保持接近的高精度模型质量。上述内容仅基于论文摘要。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。