跳到正文
热点事件观察中

QCATS以查询路由实现稀疏推理

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

QCATS 提出查询上下文感知的 Transformer 切片框架,根据查询谓词和元数据统计预选匹配的 FFN 切片,以查询级路由、异步 CPU-GPU 流水线和路由感知批处理减少数据库推理开销。 基于论文摘要,该框架在四类预测式查询工作负载、BERT-base 和 Qwen-0.6B 上将延迟最多降低 4.42 倍,同时保持与稠密基线相当的预测准确率;这些结果目前仅由摘要披露。

AI 根据报道生成 · 54 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    QCATS:用于高效预测式查询处理的查询上下文感知 Transformer 切片

    QCATS 提出查询上下文感知的 Transformer 切片框架,在数据库内实现高效稀疏推理。框架依据查询谓词与元数据统计预选匹配上下文的 FFN 切片,并采用离线专家构建、轻量级查询级路由、异步 CPU-GPU 流水线和路由感知批处理。基于论文摘要,在四类预测式查询工作负载和 BERT-base、Qwen-0.6B 上,延迟最多降低 4.42 倍,预测准确率与稠密基线相当。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。