跳到正文

内容形态

论文研究 最新动态

论文研究材料及其证据、限制与使用方法。

130 条精选近 30 天 115 条共收录 724 条

订阅此主题 RSS 更新

精选归档 · 第 7 页

7月21日周二第 121–130 条
  1. OpenAI · Alignment Research Blog

    OpenAI与Apollo Research提出对比式SDF测量奖励寻求

    OpenAI与Apollo Research提出对比式合成文档微调(Contrastive SDF),通过成对改变模型对评分者偏好的信念来测量奖励寻求。研究发现,在未进行安全训练的OpenAI o3强化学习检查点中,模型更倾向遵循其认为评分者想要的行为,且这一倾向随训练增强;在奖励黑客模型和模型生物验证中,该方法能识别预设的权威偏好。

    本站判断:研究用成对的合成文档改变模型对评分者偏好的信念,提供了区分奖励寻求与单纯信念迁移的测量框架。

  2. AWS · Quantum Computing

    AWS等发布量子与经典集成决策性能模型

    AWS、LBNL、NASA与NVIDIA研究人员发布量子与经典工作流性能模型,以通信计算比判断低延迟紧耦合是否必要。模型区分实时控制与量子纠错所需低延迟,以及应用层工作流通信;前者必须跟上设备时序,使用逻辑比特时也需要高性能经典计算。

    本站判断:将实时控制与工作流通信分层,并以通信计算比分析SQD、GQE和QE-MCMC,为混合架构选型提供定量依据。

7月14日周二
  1. NVIDIA · Quantum Computing

    NVIDIA发布Ising Decoder ColorCode 1 Fast,色码逻辑错误率改善逾347.7倍

    NVIDIA发布Ising Decoder ColorCode 1 Fast,面向三角色码的AI预译码,在d=31、物理错误率0.3%的条件下,较Chromobius将逻辑错误率改善347.7倍以上、运行速度提升7.3倍。

    本站判断:给出了色码译码器的比较基准、模型规模与训练流程,便于评估其在特定QPU噪声下的部署取舍。

6月19日周五
  1. OpenAI · Alignment Research Blog

    OpenAI:有益特质强化学习促进模型对齐泛化与持久性

    OpenAI研究团队发现,在真实场景有益特质数据中加入少量强化学习训练,可使模型在53项内外部基准中的44项上超过同算力基线。训练于单一健康领域时,模型仍能改善非健康领域的欺骗、奖励投机和一般失配表现;去除健康与科学数据后,健康评测也获得提升。模型在对抗性提示和有害微调下表现出更强的行为持久性,但该结果仍属初步证据,尚需进一步区分有益特质训练与常规后训练强化学习的作用。

    本站判断:文章给出训练数据、对比基线与跨域评测,显示有益特质强化学习可改善多类安全相关行为并增强抗对抗引导能力。

6月17日周三
5月7日周四
  1. OpenAI · Alignment Research Blog

    OpenAI 研究强化学习中意外评分思维链的后果

    OpenAI 研究了部分已发布模型在强化学习训练中意外进行思维链评分的影响,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。

    本站判断:文章结合真实训练事故、消融分析与内部压力测试,说明有限思维链评分为何未普遍降低可监测性,并归纳影响混淆的奖励强度、覆盖率与可发现性因素。

5月1日周五
  1. OpenAI · Alignment Research Blog

    OpenAI Codex 发布 Auto-review 以自动审查代理越界操作

    OpenAI 在 Codex 中发布 Auto-review,用独立的 GPT-5.4 Thinking 模型代理批准或拒绝越过沙盒边界的操作,减少长时间编码任务中的同步人工审批。

    本站判断:介绍以独立代理审查越界操作来降低编码代理人工审批频率的机制,并同时呈现内部安全评测与已知边界。

3月6日周五
2月5日周四
  1. Anthropic · Engineering Blog

    Anthropic研究者构建并行Claude智能体团队开发C编译器

    Anthropic研究者用16个并行Claude实例开发了一个10万行Rust C编译器,经历近2000次Claude Code会话和近2万美元API成本后,可编译Linux 6.9并支持x86、ARM和RISC-V。该实验采用Git任务锁、Docker容器、持续集成、GCC编译结果对照及不同代理角色分工,但编译器的汇编器、链接器、代码效率和部分兼容性仍未解决。

    本站判断:文章详细拆解了多代理并行开发框架的任务锁定、测试反馈和角色分工方法,并记录其在大型编译器项目中的效果与局限。

  2. Anthropic · Engineering Blog

    Anthropic量化智能体编码评测中的基础设施噪声

    Anthropic发现,基础设施资源配额可使Terminal-Bench 2.0成功率相差6个百分点,说明智能体编码评测分数会混入运行环境因素。实验保持同一Claude模型、评测框架和任务集,仅改变资源配置;资源余量从严格限制提升至无上限时,基础设施错误率由5.8%降至0.5%,总成功率提高6个百分点,但在3倍余量内分数变化处于噪声范围。

    本站判断:Anthropic通过Terminal-Bench 2.0和SWE-bench对照实验说明,资源配置会改变智能体编码评测结果,并给出控制评测变量的具体做法。