Skip to content

2026-08-14

GPT-5.6 模型家族发布,以更低成本实现前沿级智能体性能,新增推理持久化、多智能体编排和程序化工具调用 API,多项基准得分大幅提升,成本显著下降。 Google DeepMind 发布 Gemini 3.7 Flash,间隔三周即迭代,主打编程与智能体,输入输出价格较 3.6 减半,关乎模型竞争与开发者成本。 新研究提出“信息充裕悖论”:长上下文训练虽…

GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能 88

  • Tags: 模型发布 智能体 推理优化 API

  • Source: AI HOT 精选 | 阅读原文

[摘要]
GPT-5.6 模型家族发布,以更低成本实现前沿级智能体性能,新增推理持久化、多智能体编排和程序化工具调用 API,多项基准得分大幅提升,成本显著下降。


Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型 80

  • Tags: 模型发布 编程 智能体 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google DeepMind 发布 Gemini 3.7 Flash,间隔三周即迭代,主打编程与智能体,输入输出价格较 3.6 减半,关乎模型竞争与开发者成本。


Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge 80

  • Tags: 大模型 长上下文 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出“信息充裕悖论”:长上下文训练虽提升语境能力,却削弱模型参数化知识,超最优窗口后性能下降。对长上下文扩展方向提出重要警示。


Large Language Models Reproduce Racial Stereotypes When Used for Text Annotation 80

  • Tags: AI安全 模型偏见 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究覆盖19个LLM、400万次标注判断,发现文本中的种族身份线索使模型系统性地产生刻板印象偏差,影响自动标注在学术、审核、招聘等场景的应用,凸显AI公平性风险。


ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents 80

  • Tags: AI安全 智能体 论文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文提出ToolHazard,可扩展合成对抗环境框架,用于评估和提升LLM智能体对间接提示注入的防御能力,实验显示智能体普遍存在漏洞,并可用生成数据提升安全性。


Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed 78

  • Tags: 产品发布 推理优化 OpenAI

  • Source: OpenAI News | 阅读原文

[摘要]
OpenAI预览Ultrafast模式,基于Cerebras硬件,使GPT-5.6 Sol推理速度提升至14倍,输出速率达750 token/s,显著提升API性能。


DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验 78

  • Tags: 大模型 模型发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
DeepSeek V4 Pro正式版与Grok 4.6同日发布,参数规模均超1.5T,逼近Claude Fable 5体验,标志两大前沿模型同日竞争,值得关注。


The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance 78

  • Tags: 大模型 基准评估 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
IBM研究揭示LLM基准测试对题目措辞高度敏感,模型越强因措辞变化丢分越多,基准分数可靠性受挑战。


Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models 78

  • Tags: 推理优化 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Ripple-Pivot Search,一种免训练的扩散大语言模型并行解码方法,利用中点位置的涟漪效应加速推理,实现4-10倍加速,结合KV缓存最高18倍,且保持生成质量。


QV-PIC: Query-Aware Visual Position-Independent Caching for Efficient RAG Serving 78

  • Tags: 推理优化 RAG 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
QV-PIC 提出查询感知的视觉位置无关缓存框架,用于高效 RAG 服务,通过双分辨率图文复用提升质量并显著降低首 token 延迟,较全预填充 TTFT 降低 83.8%。


A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench 78

  • Tags: RAG 医疗AI 模型评测 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
专为印度及中低收入地区构建的临床RAG系统VITA在HealthBench上以51.9%得分超越GPT-5.4等前沿大模型,但在新模型和中性裁判评测下优势收窄至持平,表明语料特异性可提升落地能力。


Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence 78

  • Tags: 智能体 AI安全 模型解读 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
介绍Mechanist智能体系统,将AI作为科学仪器自动发现模型工作机制,可生成假设并执行实验,用于解释和控制AI,提升性能与安全性。


Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs 76

  • Tags: AI安全 大模型 对抗攻击

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示大模型易被针对性说服攻击误导,强化学习训练的说服者可将单一交互说服成功率从24%提升至93%以上,并跨模型转移,GPT-4o-mini也有25%攻击成功率,凸显对抗说服鲁棒性对多智能体系统安全的重要性。


MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型 75

  • Tags: 模型发布 开源生态 音乐生成 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
MiniMax发布Music 3.0,新一代开源权重音乐生成模型,支持根据概念和歌词一次性完成整首歌的作曲、编曲与制作,最长五分钟,提升音乐创作效率。


DeepSeek Harness v0.1 开发者预览版发布 75

  • Tags: 开源生态 智能体 开发者工具 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
DeepSeek 发布 Harness v0.1 开发者预览版,基于 Cordis 元框架、以 MIT 许可证开源,主打“一切皆插件”的智能体框架,组件可自由组合替换,具备生态影响力。


Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling 75

  • Tags: 大模型 训练方法 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
该研究通过测试时扩展视角分析在线策略蒸馏(OPD),发现OPD主要提升采样效率而非真正扩展学生模型的推理能力边界,对LLM后训练方法有重要启示。


Self-Evolving Embodied Agents via Skill-Harness Evolution 75

  • Tags: 智能体 具身智能 模型发布 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出SHAPER框架,通过进化技能与环境回滚实现免训练具身智能体自我进化,在VLABench和ESI-Bench上验证有效性,为动态环境适配提供新路径。


ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering 75

  • Tags: AI研究 医疗AI 强化学习 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究ConRub-Med提出基于共识评分规则的强化学习方法,提升开放式医学问答表现,在多个医学基准上超越现有模型,并构建了5166条评分数据集。


HarmThoughts: A Benchmark for Fine-Grained Harmful Behavior Detection in Reasoning Traces 75

  • Tags: AI安全 基准评测 推理模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准HarmThoughts用于评估推理模型在推理痕迹中逐步产生有害行为的细粒度检测,覆盖16类推理行为、5.7万句标注,揭示现有安全监控在细粒度上的不足并验证微调的可学习性。


Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers 75

  • Tags: 模型研究 推理优化 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究循环深度Transformer在单次前向传播中组合知识进行隐式推理,发现可系统泛化,且通过增加推理时循环实现深度外推,揭示三阶段grokking过程。