2026-08-26
OpenAI自研推理芯片Jalapeño首次公布结果,宣称在AI推理速度与能效上行业领先,吞吐量更高、延迟更低,对推理优化和算力格局有重要影响。 提出“Untied Self-Conditioning”方法,解决流匹配语言模型少步采样时生成质量下降问题,无需重训,8步采样困惑度降低8.6倍,显著提升生成质量。 阿里提出ERPO方法,用查询分布正则化替代策略K…
Jalapeño’s first results show industry-leading speed and efficiency in AI inference 82
Tags:
推理优化芯片算力公司动态Source:
OpenAI News| 阅读原文
[摘要]
OpenAI自研推理芯片Jalapeño首次公布结果,宣称在AI推理速度与能效上行业领先,吞吐量更高、延迟更低,对推理优化和算力格局有重要影响。
Improving Few-Step Language Flows with Untied Self-Conditioning 82
Tags:
推理优化模型发布研究突破Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出“Untied Self-Conditioning”方法,解决流匹配语言模型少步采样时生成质量下降问题,无需重训,8步采样困惑度降低8.6倍,显著提升生成质量。
Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization 82
Tags:
大模型训练方法推理优化开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
阿里提出ERPO方法,用查询分布正则化替代策略KL正则,解决LLM策略优化的稳定性-探索困境,在数学推理基准上提升精度与稳定性,已开源。
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces 82
Tags:
智能体研究突破训练方法Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出AutoSaddler,从Agent执行痕迹中自动优化外部harness,显著提升GAIA2、SWE-Bench Pro等基准性能,为可靠Agent系统提供新路径。
Training Proactive and Personalized LLM Agents 80
Tags:
智能体大模型研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出训练协作式AI智能体的PPP框架(生产力、主动性、个性化),构建UserVille模拟环境,用多目标强化学习优化,在SWE-Bench和BrowseComp-Plus上平均超越GPT-5等基线16.7分,推动智能体从任务执行转向人机协作。
Apple 发布 M6 与 M5 Ultra,性能与 AI 算力大幅跃升 78
Tags:
芯片算力公司动态产品发布Source:
AI HOT 精选| 阅读原文
[摘要]
Apple发布首款2nm芯片M6及四芯片封装M5 Ultra,AI算力与内存带宽大幅提升,将用于Mac mini和Mac Studio,利好端侧AI推理。
Apple 推出搭载 M5 Max 与 M5 Ultra 的全新 Mac Studio 78
Tags:
算力硬件发布端侧AISource:
AI HOT 精选| 阅读原文
[摘要]
Apple发布搭载M5 Max与M5 Ultra的Mac Studio,AI性能最高提升4.3倍,支持512GB统一内存,可本地运行大型LLM,四台集群分布式推理提速3倍,对端侧AI部署有重要影响。
The Collaboration Tax: How Much LLM Multi-Agent Systems Pay to Coordinate 78
Tags:
多智能体大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出“协作税”概念,量化LLM多智能体系统在协调时的性能损失,发现其与模型能力呈单调关系且可预测、部分可干预,对智能体设计有参考价值。
Unlearning Is Not Just Erasing: Temporal Decoupling via Generation Inequality 78
Tags:
研究进展大模型AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出ADU框架,通过注意力路径解耦实现大模型精准遗忘,在TOFU和WMDP基准上取得最优性能,同时较好保留模型通用能力。
Prime Agent: A Self-Improving RLM Harness 78
Tags:
智能体开源生态模型评测Source:
arXiv Computation and Language| 阅读原文
[摘要]
Prime Intellect发布开源智能体框架Prime Agent,实现自我改进的RLM harness,将ARC-AGI-3得分从30%提升至95.5%,支持长程编码、子代理协调等,值得关注。
You Need Better Attention Priors 78
Tags:
注意力机制模型优化研究突破Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出GOAT注意力机制,基于熵最优传输将标准注意力视为隐式均匀先验,改用可学习连续先验,兼容FlashAttention,可解释并解决注意力汇聚问题。
The Communication Map of a Transformer 76
Tags:
大模型可解释性研究论文Source:
arXiv Computation and Language| 阅读原文
[摘要]
该研究提出transformer的通信图,仅从权重分析所有潜在信息通道,揭示70-89%的头对耦合显著,并复原归纳回路,为可解释性提供新工具。
GIM: Evaluating models via tasks that integrate multiple cognitive domains 76
Tags:
基准测试模型评测大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准GIM通过整合多认知领域任务评估LLM,覆盖820道题,发现思维预算与量化等配置选择对性能影响不亚于模型选型,为评测提供新方向。
Restore LLM Inference Capacity in Seconds with Shadow Engine Recovery in NVIDIA Dynamo 75
Tags:
推理优化基础设施NVIDIASource:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
NVIDIA Dynamo 推出 Shadow Engine Recovery 技术,可在数秒内恢复 LLM 推理能力,替代冷重启,显著提升推理服务可用性,对大规模部署有重要价值。
WeatherNext 预测气旋:提前五天预警五级飓风 75
Tags:
模型发布AI应用开源生态Source:
AI HOT 精选| 阅读原文
[摘要]
Google AI 发布 WeatherNext 气旋预测模型,可提前五天预警五级飓风,实战测试中首次被美国国家飓风中心实时使用,代码与权重已开源,提升灾害预警能力。
v0.3.0 75
Tags:
开源生态推理优化多模态模型发布Source:
GitHub Release - llama.cpp| 阅读原文
[摘要]
llama.cpp 发布 v0.3.0,新增 dots3-note 多模态模型、GLM-4.5-Air 多 token 预测支持、DeepSeek 4 张量拆分,ggml 升级至 v0.22.0,提升推理性能与多模态能力。
Evaluation Awareness in Language Models: Representation, Verbalization, and Control 75
Tags:
AI安全模型行为研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究语言模型的“评估意识”现象,发现多个模型内部线性表征可解码评估状态,且与输出表达部分相关并受引导控制,对评测可信度提出挑战。
The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning 75
Tags:
大模型推理优化研究突破Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出LURE,将零数据自博弈LLM推理训练重构为追逃游戏,通过捕获前沿奖励和密集过程信用提升推理能力,在多个基准上超越现有方法,为减少人工数据依赖提供新思路。
Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation 75
Tags:
智能体研究论文记忆管理Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出双层智能体记忆框架,通过成本感知路由和周期性参数整合管理知识生命周期,剪枝68%冗余记忆且保持98%下游准确率,为智能体记忆提供统一范式。
Register Shifts Break LLM Safety: A Bengali Benchmark with Culturally Grounded Harms 75
Tags:
AI安全评测基准多语言Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准BanglaSafe评估孟加拉语LLM安全,发现53.6%回答不安全,正式文体比随意文体更易突破安全限制,凸显非英语安全评测缺口。