2026-08-19
OpenAI因安全事件及新模型可能达到关键网络安全能力阈值,暂时放缓模型扩展,暂停强化学习训练两周,并加强安全防护。 OpenAI宣布加强前沿AI模型的监控、对齐与安全防护,以在网络安全关键能力时代引导模型开发节奏,体现AI安全治理新进展。 研究显示智能体记忆注入需按模型能力校准:强模型适合完整指南,弱模型用精选检索效果更好,如DeepSeek-V3.2提升…
OpenAI 在"关键网络能力"时代放缓模型开发节奏 75
Tags:
公司动态AI安全大模型Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI因安全事件及新模型可能达到关键网络安全能力阈值,暂时放缓模型扩展,暂停强化学习训练两周,并加强安全防护。
Pacing model development in an era of cyber-critical capabilities 75
Tags:
AI安全公司动态Source:
OpenAI News| 阅读原文
[摘要]
OpenAI宣布加强前沿AI模型的监控、对齐与安全防护,以在网络安全关键能力时代引导模型开发节奏,体现AI安全治理新进展。
智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准 72
Tags:
智能体模型评测推理优化研究突破Source:
AI HOT 精选| 阅读原文
[摘要]
研究显示智能体记忆注入需按模型能力校准:强模型适合完整指南,弱模型用精选检索效果更好,如DeepSeek-V3.2提升+9.5pp,gpt-oss-120b提升+16.1pp且仅增5%token,无需更新权重。
Generalized Linear Bandits with Memory 72
Tags:
AI研究在线学习理论进展Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
该研究改进了带记忆的广义线性老虎机算法,将遗憾界从O(T^{3/4})提升到O(√T),统一处理了记忆效应和非线性链接函数,对在线学习理论有重要意义。
When Gradient Importance Lies: Adaptive LoRA Rank Allocation Fails Under GRPO 72
Tags:
模型微调强化学习LoRAAI研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究显示自适应LoRA秩分配在GRPO强化学习中反而降低准确率4.5个百分点,梯度景观平坦且秩分配造成放大效应,提醒SFT策略不能直接迁移到RL训练。
Whose doctor does the AI recommend? An algorithm audit of reputation and demographic signals in large language model-assisted physician choice 72
Tags:
AI安全算法审计大模型AI伦理Source:
arXiv Computation and Language| 阅读原文
[摘要]
一项针对大型语言模型辅助选择医生的大规模算法审计显示,声誉信号主导推荐,且存在对性别和族裔的系统性偏见;这些偏见在模型自身解释中不可见,凸显持续行为审计的必要性。
Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View 72
Tags:
扩散模型强化学习模型对齐研究进展Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
该论文提出将扩散模型强化学习(RL)后训练统一为路径空间视角,揭示不同算法(如Flow-GRPO、AWM)的损失源于同一原则,并提出新的价值梯度估计方法,在SD3.5-M和Qwen-Image上优于现有基线,对扩散模型对齐研究有推动意义。
QUASAR: Lowering the Loss Floor of Quantization-Aware Training with Loss-Aware Reconstruction 72
Tags:
模型训练量化优化研究发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
QUASAR提出在量化感知训练中持续进行损失感知重建,降低低比特模型损失上界,在Qwen3和Llama-3.1上2/3/4比特均达最优KL散度,2比特准确率提升3.5-4.3个百分点。
Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL 72
Tags:
智能体强化学习模型训练开源Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Envs-FORGE方法,将验证器奖励转为逐样本环境合成策略,通过MILP选择生成动作,提升智能体RL训练效果,在SWE-bench Verified上达到77.1%,超越基线,并开源代码。
Claude 现已支持 Gmail 邮件与 Google Drive 文件管理 70
Tags:
产品发布智能体AI应用Source:
AI HOT 精选| 阅读原文
[摘要]
Claude新增Gmail邮件发送与Google Drive文件管理功能,支持回复邮件线程并控制审批,所有付费套餐可用,拓展AI办公集成场景。
Strengthening democratic oversight in national security 70
Tags:
政策监管AI安全公司动态Source:
OpenAI News| 阅读原文
[摘要]
OpenAI推出新倡议,加强AI在国家安全领域的民主监督,为政府机构提供工具、培训和专业知识支持,涉及AI安全与政策监管。
ROC-n-reroll: How verifier imperfection affects test-time scaling 70
Tags:
推理优化论文Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
新研究证明验证器不完美对测试时扩展的影响:拒绝采样优于Best-of-N,二者在高计算量下收敛,且无法从低计算量外推,为推理优化提供理论指导。
Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data 70
Tags:
大模型评测方法AI安全Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
研究证明当评测模型不比被评模型更准确时,任何去偏方法最多只能将所需人工标注减半,质疑LLM-as-a-judge范式在评测前沿模型时的有效性。
Cross-Entropy Risk Estimation for Language Models: Inconsistency Must Be Dense, and the Holdout Method Is No Exception 70
Tags:
大模型研究模型评估Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
论文证明语言模型的逐词交叉熵风险无法被一致估计,连预留集方法也不例外,挑战了当前模型比较与尺度律拟合的统计基础。该结果对语言模型评估方法论有重要理论意义。
The Distributional View of Knowledge Distillation 70
Tags:
知识蒸馏模型训练研究论文Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
该论文提出知识蒸馏的分布视角,用多温度视图与传输聚合替代传统逐点KL匹配,并发现多温度聚合收益取决于温度离散度而非数量,为蒸馏损失选择提供理论依据。
Rethinking Reverse KL as Adaptive Entropy Distillation 70
Tags:
知识蒸馏大模型训练方法Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
提出自适应熵蒸馏(AED),重新审视逆KL在LLM知识蒸馏中的角色,用教师熵动态调节模仿强度,在指令跟随和数学推理上提升师生分布对齐,值得关注。
Early Stopping for Large Reasoning Models via Confidence Dynamics 70
Tags:
推理优化大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出CoDE-Stop早停方法,通过中间答案置信度动态判断大推理模型何时停止推理,无需额外训练,可减少25-50%推理token,平衡准确率与计算成本。
TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes 70
Tags:
推理优化模型服务MoE负载均衡Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文提出TEMPO,面向MoE专家并行的感知完工时间负载均衡调度器,处理内存与计算受限混合场景,最高提升15.5%吞吐、降低约15.6%的p99延迟,对推理系统优化有参考价值。
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks 70
Tags:
智能体研究并行推理Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出AggAgent聚合智能体,通过工具化方式整合长程智能体任务的并行轨迹,在六个基准和三个模型系列上优于现有聚合方法,提升并行测试时扩展的效率。
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages 70
Tags:
智能体多智能体推理研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
一篇关于多智能体推理的论文提出DHD协议,发现错误答案也能提供有用推理轨迹,可帮助后续推理,挑战了仅依据正确性过滤消息的常规做法,对多智能体学习有价值。