Skip to content

2026-08-19

OpenAI因安全事件及新模型可能达到关键网络安全能力阈值,暂时放缓模型扩展,暂停强化学习训练两周,并加强安全防护。 OpenAI宣布加强前沿AI模型的监控、对齐与安全防护,以在网络安全关键能力时代引导模型开发节奏,体现AI安全治理新进展。 研究显示智能体记忆注入需按模型能力校准:强模型适合完整指南,弱模型用精选检索效果更好,如DeepSeek-V3.2提升…

OpenAI 在"关键网络能力"时代放缓模型开发节奏 75

  • Tags: 公司动态 AI安全 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI因安全事件及新模型可能达到关键网络安全能力阈值,暂时放缓模型扩展,暂停强化学习训练两周,并加强安全防护。


Pacing model development in an era of cyber-critical capabilities 75

  • Tags: AI安全 公司动态

  • Source: OpenAI News | 阅读原文

[摘要]
OpenAI宣布加强前沿AI模型的监控、对齐与安全防护,以在网络安全关键能力时代引导模型开发节奏,体现AI安全治理新进展。


智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准 72

  • Tags: 智能体 模型评测 推理优化 研究突破

  • Source: AI HOT 精选 | 阅读原文

[摘要]
研究显示智能体记忆注入需按模型能力校准:强模型适合完整指南,弱模型用精选检索效果更好,如DeepSeek-V3.2提升+9.5pp,gpt-oss-120b提升+16.1pp且仅增5%token,无需更新权重。


Generalized Linear Bandits with Memory 72

  • Tags: AI研究 在线学习 理论进展

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
该研究改进了带记忆的广义线性老虎机算法,将遗憾界从O(T^{3/4})提升到O(√T),统一处理了记忆效应和非线性链接函数,对在线学习理论有重要意义。


When Gradient Importance Lies: Adaptive LoRA Rank Allocation Fails Under GRPO 72

  • Tags: 模型微调 强化学习 LoRA AI研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究显示自适应LoRA秩分配在GRPO强化学习中反而降低准确率4.5个百分点,梯度景观平坦且秩分配造成放大效应,提醒SFT策略不能直接迁移到RL训练。


Whose doctor does the AI recommend? An algorithm audit of reputation and demographic signals in large language model-assisted physician choice 72

  • Tags: AI安全 算法审计 大模型 AI伦理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
一项针对大型语言模型辅助选择医生的大规模算法审计显示,声誉信号主导推荐,且存在对性别和族裔的系统性偏见;这些偏见在模型自身解释中不可见,凸显持续行为审计的必要性。


Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View 72

  • Tags: 扩散模型 强化学习 模型对齐 研究进展

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
该论文提出将扩散模型强化学习(RL)后训练统一为路径空间视角,揭示不同算法(如Flow-GRPO、AWM)的损失源于同一原则,并提出新的价值梯度估计方法,在SD3.5-M和Qwen-Image上优于现有基线,对扩散模型对齐研究有推动意义。


QUASAR: Lowering the Loss Floor of Quantization-Aware Training with Loss-Aware Reconstruction 72

  • Tags: 模型训练 量化优化 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
QUASAR提出在量化感知训练中持续进行损失感知重建,降低低比特模型损失上界,在Qwen3和Llama-3.1上2/3/4比特均达最优KL散度,2比特准确率提升3.5-4.3个百分点。


Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL 72

  • Tags: 智能体 强化学习 模型训练 开源

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Envs-FORGE方法,将验证器奖励转为逐样本环境合成策略,通过MILP选择生成动作,提升智能体RL训练效果,在SWE-bench Verified上达到77.1%,超越基线,并开源代码。


Claude 现已支持 Gmail 邮件与 Google Drive 文件管理 70

  • Tags: 产品发布 智能体 AI应用

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Claude新增Gmail邮件发送与Google Drive文件管理功能,支持回复邮件线程并控制审批,所有付费套餐可用,拓展AI办公集成场景。


Strengthening democratic oversight in national security 70

  • Tags: 政策监管 AI安全 公司动态

  • Source: OpenAI News | 阅读原文

[摘要]
OpenAI推出新倡议,加强AI在国家安全领域的民主监督,为政府机构提供工具、培训和专业知识支持,涉及AI安全与政策监管。


ROC-n-reroll: How verifier imperfection affects test-time scaling 70

  • Tags: 推理优化 论文

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
新研究证明验证器不完美对测试时扩展的影响:拒绝采样优于Best-of-N,二者在高计算量下收敛,且无法从低计算量外推,为推理优化提供理论指导。


Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data 70

  • Tags: 大模型 评测方法 AI安全

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
研究证明当评测模型不比被评模型更准确时,任何去偏方法最多只能将所需人工标注减半,质疑LLM-as-a-judge范式在评测前沿模型时的有效性。


Cross-Entropy Risk Estimation for Language Models: Inconsistency Must Be Dense, and the Holdout Method Is No Exception 70

  • Tags: 大模型 研究 模型评估

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
论文证明语言模型的逐词交叉熵风险无法被一致估计,连预留集方法也不例外,挑战了当前模型比较与尺度律拟合的统计基础。该结果对语言模型评估方法论有重要理论意义。


The Distributional View of Knowledge Distillation 70

  • Tags: 知识蒸馏 模型训练 研究论文

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
该论文提出知识蒸馏的分布视角,用多温度视图与传输聚合替代传统逐点KL匹配,并发现多温度聚合收益取决于温度离散度而非数量,为蒸馏损失选择提供理论依据。


Rethinking Reverse KL as Adaptive Entropy Distillation 70

  • Tags: 知识蒸馏 大模型 训练方法

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出自适应熵蒸馏(AED),重新审视逆KL在LLM知识蒸馏中的角色,用教师熵动态调节模仿强度,在指令跟随和数学推理上提升师生分布对齐,值得关注。


Early Stopping for Large Reasoning Models via Confidence Dynamics 70

  • Tags: 推理优化 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出CoDE-Stop早停方法,通过中间答案置信度动态判断大推理模型何时停止推理,无需额外训练,可减少25-50%推理token,平衡准确率与计算成本。


TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes 70

  • Tags: 推理优化 模型服务 MoE 负载均衡

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文提出TEMPO,面向MoE专家并行的感知完工时间负载均衡调度器,处理内存与计算受限混合场景,最高提升15.5%吞吐、降低约15.6%的p99延迟,对推理系统优化有参考价值。


Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks 70

  • Tags: 智能体 研究 并行推理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出AggAgent聚合智能体,通过工具化方式整合长程智能体任务的并行轨迹,在六个基准和三个模型系列上优于现有聚合方法,提升并行测试时扩展的效率。


Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages 70

  • Tags: 智能体 多智能体 推理 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
一篇关于多智能体推理的论文提出DHD协议,发现错误答案也能提供有用推理轨迹,可帮助后续推理,挑战了仅依据正确性过滤消息的常规做法,对多智能体学习有价值。