跳到正文

动态展示门槛:AI 前沿与应用 ≥ 65 分,量子方向 ≥ 60 分;已确认精选照常展示。

今天10月8日周四1 条
  1. Anthropic · News

    Anthropic 发布 Claude Haiku 5.5 小模型

    Anthropic 发布 Claude Haiku 5.5,定位为面向高吞吐、成本敏感任务的小模型。官方称其平均运行成本较 Haiku 4.5 低约75%,并提供可调 effort 设置;模型已在 Claude Platform、Amazon Web Services、Google Cloud 和 Microsoft Azure 上提供。

    本站判断:提供可调 effort、基准与定价对照,帮助开发者评估其在高吞吐代理任务中的速度、成本和能力取舍。

10月6日周二
10月5日周一
  1. IBM Quantum

    IBM Quantum 发布定向执行模型与 Executor 原语

    IBM Quantum 发布 directed execution 定向执行模型,以 Executor 作为底层入口,将量子电路的变换、随机化和缓解流程前移至客户端,同时保留 100+ 量子比特系统的性能。

    本站判断:它把纠错与缓解流程从服务器黑箱前移到客户端,同时保留Sampler和Estimator兼容性,便于研究者检查、组合并扩展电路工作流。

10月2日周五
9月28日周一
9月24日周四
  1. Pasqal Newsroom

    Pasqal公布2026年上半年财务结果及量子部署进展

    Pasqal公布2026年上半年财务结果:营收为490万欧元,同比增长14%,其中QPU相关服务收入为390万欧元,同比增长34%。截至6月30日,公司已签订和获授业务达7040万欧元,经营亏损为5920万欧元,现金及现金等价物为1.108亿欧元。公司还披露了Orion Beta模拟磁性材料、扩展至1024个原子的无缺陷寄存器,以及基于逻辑比特求解微分方程等技术和部署进展。

    本站判断:半年财报同时披露收入、客户部署与中性原子硬件进展,便于判断技术进展如何转化为商业订单和实际部署。

6月12日周五
5月25日周一
  1. Anthropic · Engineering Blog

    Anthropic 介绍如何通过环境隔离限制 Claude 代理的爆炸半径

    Anthropic 介绍如何通过环境边界、模型防护和外部内容控制,限制 Claude 在 claude.ai、Claude Code 与 Claude Cowork 中的潜在影响范围。文章结合 93% 权限提示批准率、84% 权限提示减少,以及恶意配置、提示注入和白名单外传等案例,强调环境层隔离、用户监督能力匹配和成熟安全组件的重要性。

    本站判断:文章以三款 Claude 产品的隔离架构和安全事件为主线,给出可迁移的环境边界、权限分层与代理安全设计原则。

5月11日周一
  1. MACE · Releases

    MACE v0.3.16 发布并加入 MACE-POLAR-1 基础模型

    MACE 发布 v0.3.16,新增 MACE-POLAR-1 可极化静电基础模型家族,并加入 torch.compile、OpenEquivariance、混合内核和 TorchSim 接口等性能与基础设施更新。

    本站判断:该版本同时提供可极化静电基础模型、训练数据与计算接口说明,便于评估其在分子能量、力和电荷预测中的使用路径。

3月25日周三
  1. Anthropic · Engineering Blog

    Anthropic 如何构建 Claude Code auto mode:以模型分类器减少权限确认

    Anthropic 为 Claude Code 推出 auto mode,用模型分类器替代人工批准操作,并通过输入层提示注入探测和输出层分类器检查高风险行为。分类器由 Sonnet 4.6 运行,先进行单令牌快速过滤,再对可疑操作进行推理复核;其完整流程将真实流量误报率从8.5%降至0.4%,但真实过度主动操作的漏报率为17%,合成数据外泄任务的漏报率为5.7%。

    本站判断:Anthropic 拆解了 Claude Code auto mode 的双层安全架构与评估取舍,有助于理解模型分类器如何减少权限确认及其残余风险。

3月24日周二
  1. Anthropic · Engineering Blog

    Anthropic 介绍 Claude 长时应用开发的规划器、生成器与评估器架构

    Anthropic Labs 团队提出由规划器、生成器和评估器组成的 Claude 多智能体 harness,用于让模型在多小时的自主开发中生成更完整的应用。该方法结合结构化交接、独立评估和 Playwright MCP 页面检查,并应用于前端设计与全栈编码。

    本站判断:文章给出规划器、生成器、评估器与结构化交接的组合方式,并用前端设计和全栈应用实验说明如何权衡长程开发质量、时延与成本。

2月5日周四
  1. Anthropic · Engineering Blog

    Anthropic量化智能体编码评测中的基础设施噪声

    Anthropic发现,基础设施资源配额可使Terminal-Bench 2.0成功率相差6个百分点,说明智能体编码评测分数会混入运行环境因素。实验保持同一Claude模型、评测框架和任务集,仅改变资源配置;资源余量从严格限制提升至无上限时,基础设施错误率由5.8%降至0.5%,总成功率提高6个百分点,但在3倍余量内分数变化处于噪声范围。

    本站判断:Anthropic通过Terminal-Bench 2.0和SWE-bench对照实验说明,资源配置会改变智能体编码评测结果,并给出控制评测变量的具体做法。

2025年12月18日周四
  1. NVIDIA · Quantum Computing

    NVIDIA CUDA-Q QEC 0.5.0 增加实时译码、GPU译码器与AI推理能力

    NVIDIA CUDA-Q QEC 0.5.0 增加在线实时译码、GPU加速算法译码、AI译码器推理和滑动窗口译码支持,可通过检测器误差模型生成、译码器配置、加载初始化和实时译码四步流程运行。

    本站判断:提供从检测器误差模型到实时译码的完整流程,并同时覆盖GPU算法译码、AI推理与滑动窗口,便于比较不同QEC译码路径。