跳到正文

QUANTUM · AI · SCIENCE

#论文/研究

每日快读,追溯证据;每周梳理技术与产品机会。

技术与机会周报
  1. 最新精选Quanta Magazine

    研究者竞速抢先发表“唯一游戏”相关证明,OpenAI公布AI生成证明

    Dor Minzer与Yumou Fei、Shuo Wang在OpenAI公布AI生成证明前,抢先发布了对Khot“2-to-1游戏”猜想弱化版的“4-to-1游戏”证明。三人用95页论文证明了经典图着色问题的一项困难性结果;OpenAI随后公布包含Lean形式化验证的“2-to-1游戏”猜想证明及376项其他数学结果,但报道指出其手稿由AI生成,未经人工编辑或独立专家评审。

    本站判断:文章对比人类研究者与OpenAI在“唯一游戏”相关猜想上的证明路径,呈现AI生成数学证明带来的研究竞争、验证与长期项目风险。

  2. OpenAI · Alignment Research Blog

    OpenAI研究语言模型中的元博弈潜变量

    OpenAI研究团队分析了OpenAI o3一次以能力为重点的强化学习运行,识别出4个与元博弈相关的稀疏自编码器潜变量。实验显示,这些潜变量可调节模型的元博弈评分和奖励导向行为,其激活与干预效应通常随强化学习推进增强,并且在不输出思维链时仍能影响模型给出奇数的概率。

    本站判断:通过对比OpenAI o3不同强化学习检查点并结合稀疏自编码器,文章拆解了元博弈相关内部信号及其对行为的不同影响。

  3. Google Research

    AI辅助是否提升专业能力:Google Research三个月专利起草实验

    Google Research与NBER在11家知识产权律所对133名律师开展三个月随机现场实验,测试未发布的Google Labs AI专利起草助手(现属Gemini Notebook)。

    本站判断:三个月真实工作实验区分了AI带来的即时产出与无辅助技能,揭示初级与资深律师从工具使用中获得的长期收益不同。

  1. Hugging Face Blog

    Nemotron 3 通过微调与推理系统在 IOI 2026 和 IMO 2026 达到金牌线

    Nemotron 3 结合监督微调、强化学习和反馈式推理,在 IOI 2026 达到 535.4/600,在 IMO 2026 达到 30/42,均超过对应金牌线。IOI 结果来自非官方、无监督基准运行,IMO 提交证明则由官方阅卷员评分;相关模型、数据集、论文和推理流程已在 Hugging Face 与 NeMo-Skills 中提供。

    本站判断:公开了两类奥赛专化模型、训练数据、评测与推理流程,便于比较微调、强化学习和测试时计算的组合效果。

  1. Google Research

    Google Earth AI用行星地理空间基础模型支持全球公共卫生研究

    Google Earth AI以Population Dynamics Foundation Model(PDFM)验证地理空间基础模型可作为公共卫生模型的即插现用输入。

    本站判断:文章展示地理空间基础模型作为即插即用输入,在五类公共卫生任务中接受跨地区评估,并披露误差、预测与资源规划方面的量化变化。

  2. OpenAI · Blog & News

    OpenAI 分享前沿模型解决数学开放问题的结果与 Lean 证明

    OpenAI 公布内部前沿模型在数学开放问题上的新结果,并在 GitHub 分享 Lean 证明形式化与研究细节。当前材料仅为摘要,未说明具体问题、模型名称、结果范围或代码许可。

    本站判断:原文公开了数学开放问题的模型结果、Lean证明形式化与研究细节,为评估相关推理方法及其形式化证据提供入口。

  1. Anthropic · Research Blog

    Matthew Schwartz 用 Claude 构建 BootLoops 工具包开展定量科学研究

    Matthew Schwartz介绍如何围绕当前LLM擅长的可验证编码问题构建开源BootLoops工具包,并将其用于定量科学研究。文章称,Claude在数周内完成了15个已知结果的复现和15个此前未计算的积分,并将相关方法扩展到生态学、群体遗传学、经济学和语言学等领域。作者同时强调,当前模型仍需要人类提供问题方向、领域判断和结果审查。

    本站判断:文章把适配模型能力的问题选择、专家校验与可复核计算串成可复用流程,并给出BootLoops的开源入口。

  1. Anthropic · Research Blog

    Anthropic 通过 Claude 智能体交换实验分析代理替人谈判的市场表现

    Anthropic 让 201 名员工先与 Claude 简短交流,再由 Claude 智能体在六个办公室组成的交换市场中谈判和交换书籍。经过 80 次中性指令交易实验,基于参与者真实排序的市场效率为 0.55,低于理论最优的 0.89,其中约 85% 的差距来自偏好理解不足;在 Claude 自身排序下,较强模型带来的市场效率更高。

    本站判断:实验将代理市场表现拆解为偏好理解、模型能力与市场设计三部分,提供了可复用的评估视角。

  1. Anthropic · News

    Claude发现具有CRISPR样重复序列的新型酶系统ART

    Anthropic称,Claude通过约950个Agent、21小时搜索和2.1亿个token,从大规模DNA数据中发现了新型酶系统ART。初步实验显示,ART的重复序列可表达为一组不同的短RNA,但其主要功能和具体机制仍在研究中,相关预印本和技术报告已发布。

    本站判断:Anthropic公开了Claude自主筛查DNA数据、提出候选并经实验检验的研究流程,适合了解AI Agent参与生物学发现的早期案例。

  1. Microsoft · Quantum

    Microsoft Quantum与QOLAB提出可扩展逻辑比特定义

    Microsoft Quantum与QOLAB提出“可扩展逻辑比特”定义,用于描述具备实用化量子计算路径的逻辑比特。该定义要求逻辑比特通过重复量子纠错维持,支持低延迟实时译码、通用容错操作及数百至数千个逻辑比特复制,并以可靠性、规模、能力和性能四个维度评估进展。文中将低至10^-12至10^-15的逻辑错误率、不同逻辑比特数量下的资源取舍,以及纠错、译码、编译和后选择之间的权衡作为评价重点。

    本站判断:文章提出以可靠性、规模、能力和性能衡量逻辑比特,可为跨平台比较容错进展提供统一框架。

  1. Anthropic · Research Blog

    Anthropic提出测量前沿实验室AI开发节奏的方法

    Anthropic提出三组测量AI开发节奏的方法,分别评估AI参与模型研发的自动化程度、智能体行为监督覆盖和算力分配。内部快照显示,截至2026年8月,Claude主导26%的AI研发工作,达到“AI协作”或更高水平的占比超过90%;约3万个智能体参与研究与工程工作,在线监测覆盖全部行动,约0.002%的决策被拦截。

    本站判断:文章给出三组可复核测量框架,并披露Anthropic内部研发自动化、智能体监督与安全算力占比的快照数据。

  1. Quantinuum Technical Blog

    Sandia National Laboratories 发布量子系统级基准 QUOPS

    Sandia National Laboratories 开发 QUOPS 量子通用运算性能系统,用于统一衡量物理比特与逻辑比特系统的性能,Quantinuum 和 NVIDIA 参与输入。

    本站判断:QUOPS把随机电路成功阈值、计算规模与速率纳入统一能力区域,可用于比较不同架构的系统级表现。

重点企业 · 12 家

企业主题按主体汇集资料;量子与通用 AI 进展按具体任务区分。