Skip to content

2026-08-26

OpenAI自研推理芯片Jalapeño首次公布结果,宣称在AI推理速度与能效上行业领先,吞吐量更高、延迟更低,对推理优化和算力格局有重要影响。 提出“Untied Self-Conditioning”方法,解决流匹配语言模型少步采样时生成质量下降问题,无需重训,8步采样困惑度降低8.6倍,显著提升生成质量。 阿里提出ERPO方法,用查询分布正则化替代策略K…

Jalapeño’s first results show industry-leading speed and efficiency in AI inference 82

  • Tags: 推理优化 芯片算力 公司动态

  • Source: OpenAI News | 阅读原文

[摘要]
OpenAI自研推理芯片Jalapeño首次公布结果,宣称在AI推理速度与能效上行业领先,吞吐量更高、延迟更低,对推理优化和算力格局有重要影响。


Improving Few-Step Language Flows with Untied Self-Conditioning 82

  • Tags: 推理优化 模型发布 研究突破

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出“Untied Self-Conditioning”方法,解决流匹配语言模型少步采样时生成质量下降问题,无需重训,8步采样困惑度降低8.6倍,显著提升生成质量。


Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization 82

  • Tags: 大模型 训练方法 推理优化 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
阿里提出ERPO方法,用查询分布正则化替代策略KL正则,解决LLM策略优化的稳定性-探索困境,在数学推理基准上提升精度与稳定性,已开源。


AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces 82

  • Tags: 智能体 研究突破 训练方法

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出AutoSaddler,从Agent执行痕迹中自动优化外部harness,显著提升GAIA2、SWE-Bench Pro等基准性能,为可靠Agent系统提供新路径。


Training Proactive and Personalized LLM Agents 80

  • Tags: 智能体 大模型 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出训练协作式AI智能体的PPP框架(生产力、主动性、个性化),构建UserVille模拟环境,用多目标强化学习优化,在SWE-Bench和BrowseComp-Plus上平均超越GPT-5等基线16.7分,推动智能体从任务执行转向人机协作。


Apple 发布 M6 与 M5 Ultra,性能与 AI 算力大幅跃升 78

  • Tags: 芯片算力 公司动态 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Apple发布首款2nm芯片M6及四芯片封装M5 Ultra,AI算力与内存带宽大幅提升,将用于Mac mini和Mac Studio,利好端侧AI推理。


Apple 推出搭载 M5 Max 与 M5 Ultra 的全新 Mac Studio 78

  • Tags: 算力 硬件发布 端侧AI

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Apple发布搭载M5 Max与M5 Ultra的Mac Studio,AI性能最高提升4.3倍,支持512GB统一内存,可本地运行大型LLM,四台集群分布式推理提速3倍,对端侧AI部署有重要影响。


The Collaboration Tax: How Much LLM Multi-Agent Systems Pay to Coordinate 78

  • Tags: 多智能体 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出“协作税”概念,量化LLM多智能体系统在协调时的性能损失,发现其与模型能力呈单调关系且可预测、部分可干预,对智能体设计有参考价值。


Unlearning Is Not Just Erasing: Temporal Decoupling via Generation Inequality 78

  • Tags: 研究进展 大模型 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出ADU框架,通过注意力路径解耦实现大模型精准遗忘,在TOFU和WMDP基准上取得最优性能,同时较好保留模型通用能力。


Prime Agent: A Self-Improving RLM Harness 78

  • Tags: 智能体 开源生态 模型评测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Prime Intellect发布开源智能体框架Prime Agent,实现自我改进的RLM harness,将ARC-AGI-3得分从30%提升至95.5%,支持长程编码、子代理协调等,值得关注。


You Need Better Attention Priors 78

  • Tags: 注意力机制 模型优化 研究突破

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出GOAT注意力机制,基于熵最优传输将标准注意力视为隐式均匀先验,改用可学习连续先验,兼容FlashAttention,可解释并解决注意力汇聚问题。


The Communication Map of a Transformer 76

  • Tags: 大模型 可解释性 研究论文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
该研究提出transformer的通信图,仅从权重分析所有潜在信息通道,揭示70-89%的头对耦合显著,并复原归纳回路,为可解释性提供新工具。


GIM: Evaluating models via tasks that integrate multiple cognitive domains 76

  • Tags: 基准测试 模型评测 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准GIM通过整合多认知领域任务评估LLM,覆盖820道题,发现思维预算与量化等配置选择对性能影响不亚于模型选型,为评测提供新方向。


Restore LLM Inference Capacity in Seconds with Shadow Engine Recovery in NVIDIA Dynamo 75

  • Tags: 推理优化 基础设施 NVIDIA

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
NVIDIA Dynamo 推出 Shadow Engine Recovery 技术,可在数秒内恢复 LLM 推理能力,替代冷重启,显著提升推理服务可用性,对大规模部署有重要价值。


WeatherNext 预测气旋:提前五天预警五级飓风 75

  • Tags: 模型发布 AI应用 开源生态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google AI 发布 WeatherNext 气旋预测模型,可提前五天预警五级飓风,实战测试中首次被美国国家飓风中心实时使用,代码与权重已开源,提升灾害预警能力。


v0.3.0 75

  • Tags: 开源生态 推理优化 多模态 模型发布

  • Source: GitHub Release - llama.cpp | 阅读原文

[摘要]
llama.cpp 发布 v0.3.0,新增 dots3-note 多模态模型、GLM-4.5-Air 多 token 预测支持、DeepSeek 4 张量拆分,ggml 升级至 v0.22.0,提升推理性能与多模态能力。


Evaluation Awareness in Language Models: Representation, Verbalization, and Control 75

  • Tags: AI安全 模型行为 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究语言模型的“评估意识”现象,发现多个模型内部线性表征可解码评估状态,且与输出表达部分相关并受引导控制,对评测可信度提出挑战。


The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning 75

  • Tags: 大模型 推理优化 研究突破

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出LURE,将零数据自博弈LLM推理训练重构为追逃游戏,通过捕获前沿奖励和密集过程信用提升推理能力,在多个基准上超越现有方法,为减少人工数据依赖提供新思路。


Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation 75

  • Tags: 智能体 研究论文 记忆管理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出双层智能体记忆框架,通过成本感知路由和周期性参数整合管理知识生命周期,剪枝68%冗余记忆且保持98%下游准确率,为智能体记忆提供统一范式。


Register Shifts Break LLM Safety: A Bengali Benchmark with Culturally Grounded Harms 75

  • Tags: AI安全 评测基准 多语言

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准BanglaSafe评估孟加拉语LLM安全,发现53.6%回答不安全,正式文体比随意文体更易突破安全限制,凸显非英语安全评测缺口。