跳到正文

内容形态

论文研究 最新动态

论文研究材料及其证据、限制与使用方法。

95 条精选近 30 天 82 条共收录 509 条

订阅此主题 RSS 更新

精选归档 · 第 5 页

9月14日周一第 81–95 条
9月10日周四
  1. Quantinuum Technical Blog

    Quantinuum在System Model H2上实验验证补采样游戏的量子优势

    Quantinuum团队在System Model H2上运行数千个电路,实验验证补采样游戏中量子策略相对经典策略的可证明优势,相关成果发表于《Nature Communications》。该测试不依赖纠缠或经典计算困难度假设,经典系统可高效验证其是否违反性能上界,实验得分接近理论预测。作者同时指出,实现依赖输入状态制备假设,结果仍需谨慎解读。

    本站判断:该实验将可高效验证的经典性能上界与H2实测结合,为判断设备是否展现非经典能力提供更直接的验证思路。

9月8日周二
  1. Quantinuum Technical Blog

    Quantinuum在Helios上实验验证Helix容错量子计算架构

    Quantinuum在商业硬件Helios上实验验证Helix量子纠错架构,展示了逻辑存储、逻辑计算以及跨不同纠错码的逻辑纠缠,相关结果在未使用后选择时均优于对应物理层结果。

    本站判断:文章在商业硬件上报告了逻辑存储、计算与跨编码纠缠结果,并给出相对物理层基线的错误率比较。

8月6日周四
  1. AWS · Quantum Computing

    AWS与JPMorganChase合作开展量子优化研究

    AWS与JPMorganChase合作提出面向近端量子硬件的组合优化分解流程、Rydberg原子阵列编译工具和混合算法qReduMIS。实验显示,分解流程可将真实投资组合优化问题规模降低约80%,并在最多1500个变量的问题上实现3倍求解时间缩短;qReduMIS在Amazon Braket上使用QuEra Aquila设备进行最多231量子比特的实验,困难实例平均成功率超过约89%。

    本站判断:三项研究把组合优化分解、硬件编译与量子经典协同串成工具链,并报告真实设备实验指标,便于比较近端量子优化方案。

7月24日周五
  1. AWS · Quantum Computing

    QuEra Aquila Rydberg量子模拟器用于无序材料热力学采样

    研究团队将基于经典密度泛函理论的材料能量模型映射到QuEra Aquila中性原子量子硬件,用量子退火采样氮掺杂石墨烯的热力学状态。在28位点系统上通过穷举将有效温度校准为41μK,在78位点系统上与无偏蒙特卡洛比较,并展示通过4.0、4.5和5.0微米原子间距调节有效温度。该工作是概念验证,QPU每个数据点运行1000次,最终仅保留初始构型完全占据的运行。

    本站判断:以小规模穷举和经典蒙特卡洛作为基线,给出中性原子量子退火用于无序材料热力学采样的概念验证。

7月21日周二
  1. OpenAI · Alignment Research Blog

    OpenAI与Apollo Research提出对比式SDF测量奖励寻求

    OpenAI与Apollo Research提出对比式合成文档微调(Contrastive SDF),通过成对改变模型对评分者偏好的信念来测量奖励寻求。研究发现,在未进行安全训练的OpenAI o3强化学习检查点中,模型更倾向遵循其认为评分者想要的行为,且这一倾向随训练增强;在奖励黑客模型和模型生物验证中,该方法能识别预设的权威偏好。

    本站判断:研究用成对的合成文档改变模型对评分者偏好的信念,提供了区分奖励寻求与单纯信念迁移的测量框架。

  2. AWS · Quantum Computing

    AWS等发布量子与经典集成决策性能模型

    AWS、LBNL、NASA与NVIDIA研究人员发布量子与经典工作流性能模型,以通信计算比判断低延迟紧耦合是否必要。模型区分实时控制与量子纠错所需低延迟,以及应用层工作流通信;前者必须跟上设备时序,使用逻辑比特时也需要高性能经典计算。

    本站判断:将实时控制与工作流通信分层,并以通信计算比分析SQD、GQE和QE-MCMC,为混合架构选型提供定量依据。

7月14日周二
  1. NVIDIA · Quantum Computing

    NVIDIA发布Ising Decoder ColorCode 1 Fast,色码逻辑错误率改善逾347.7倍

    NVIDIA发布Ising Decoder ColorCode 1 Fast,面向三角色码的AI预译码,在d=31、物理错误率0.3%的条件下,较Chromobius将逻辑错误率改善347.7倍以上、运行速度提升7.3倍。

    本站判断:给出了色码译码器的比较基准、模型规模与训练流程,便于评估其在特定QPU噪声下的部署取舍。

6月19日周五
  1. OpenAI · Alignment Research Blog

    OpenAI:有益特质强化学习促进模型对齐泛化与持久性

    OpenAI研究团队发现,在真实场景有益特质数据中加入少量强化学习训练,可使模型在53项内外部基准中的44项上超过同算力基线。训练于单一健康领域时,模型仍能改善非健康领域的欺骗、奖励投机和一般失配表现;去除健康与科学数据后,健康评测也获得提升。模型在对抗性提示和有害微调下表现出更强的行为持久性,但该结果仍属初步证据,尚需进一步区分有益特质训练与常规后训练强化学习的作用。

    本站判断:文章给出训练数据、对比基线与跨域评测,显示有益特质强化学习可改善多类安全相关行为并增强抗对抗引导能力。

6月17日周三
5月7日周四
  1. OpenAI · Alignment Research Blog

    OpenAI 研究强化学习中意外评分思维链的后果

    OpenAI 研究了部分已发布模型在强化学习训练中意外进行思维链评分的影响,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。

    本站判断:文章结合真实训练事故、消融分析与内部压力测试,说明有限思维链评分为何未普遍降低可监测性,并归纳影响混淆的奖励强度、覆盖率与可发现性因素。

5月1日周五
  1. OpenAI · Alignment Research Blog

    OpenAI Codex 发布 Auto-review 以自动审查代理越界操作

    OpenAI 在 Codex 中发布 Auto-review,用独立的 GPT-5.4 Thinking 模型代理批准或拒绝越过沙盒边界的操作,减少长时间编码任务中的同步人工审批。

    本站判断:介绍以独立代理审查越界操作来降低编码代理人工审批频率的机制,并同时呈现内部安全评测与已知边界。

3月6日周五
2月5日周四
  1. Anthropic · Engineering Blog

    Anthropic研究者构建并行Claude智能体团队开发C编译器

    Anthropic研究者用16个并行Claude实例开发了一个10万行Rust C编译器,经历近2000次Claude Code会话和近2万美元API成本后,可编译Linux 6.9并支持x86、ARM和RISC-V。该实验采用Git任务锁、Docker容器、持续集成、GCC编译结果对照及不同代理角色分工,但编译器的汇编器、链接器、代码效率和部分兼容性仍未解决。

    本站判断:文章详细拆解了多代理并行开发框架的任务锁定、测试反馈和角色分工方法,并记录其在大型编译器项目中的效果与局限。

  2. Anthropic · Engineering Blog

    Anthropic量化智能体编码评测中的基础设施噪声

    Anthropic发现,基础设施资源配额可使Terminal-Bench 2.0成功率相差6个百分点,说明智能体编码评测分数会混入运行环境因素。实验保持同一Claude模型、评测框架和任务集,仅改变资源配置;资源余量从严格限制提升至无上限时,基础设施错误率由5.8%降至0.5%,总成功率提高6个百分点,但在3倍余量内分数变化处于噪声范围。

    本站判断:Anthropic通过Terminal-Bench 2.0和SWE-bench对照实验说明,资源配置会改变智能体编码评测结果,并给出控制评测变量的具体做法。