Cascadia在11台AI PC运行975B模型
热点事件观察中
Cascadia在11台AI PC运行975B模型
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Tate Berenbaum、Matias Parij和Muthaiah Venkatachalam提出并评估Cascadia。基于论文摘要,该分布式稀疏MoE方案让总参数975B、激活参数41B的Inkling模型常驻11台Intel Core Ultra X7 358H AI PC,并以定制引擎协调专家路由、融合GPU图和FP16计算。 实测中,密集层调用时间由约8.1毫秒降至4.5毫秒;88路并发时聚合解码速度达60.29 token/s,完整服务阶段为46.87 token/s,15路并发时首 token 中位延迟为6.05秒。提高上下文预算后,1K至64K真实提示在19次测试中均成功恢复嵌入代码,但长上下文延迟受单机CPU注意力循环限制。
AI 根据报道生成 · 38 分钟前更新
最新进展10月7日 12:00
Cascadia:让975B总参数 Inkling 模型常驻于11台 Intel AI PC报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AICascadia:让975B总参数 Inkling 模型常驻于11台 Intel AI PC
基于论文摘要,Cascadia 在11台Intel Core Ultra X7 358H AI PC上实现975B总参数、41B激活参数的Inkling模型常驻推理,并定制稀疏MoE引擎协调专家路由、OpenVINO融合GPU图和FP16计算。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。