2026-08-14
GPT-5.6 模型家族发布,以更低成本实现前沿级智能体性能,新增推理持久化、多智能体编排和程序化工具调用 API,多项基准得分大幅提升,成本显著下降。 Google DeepMind 发布 Gemini 3.7 Flash,间隔三周即迭代,主打编程与智能体,输入输出价格较 3.6 减半,关乎模型竞争与开发者成本。 新研究提出“信息充裕悖论”:长上下文训练虽…
GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能 88
Tags:
模型发布智能体推理优化APISource:
AI HOT 精选| 阅读原文
[摘要]
GPT-5.6 模型家族发布,以更低成本实现前沿级智能体性能,新增推理持久化、多智能体编排和程序化工具调用 API,多项基准得分大幅提升,成本显著下降。
Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型 80
Tags:
模型发布编程智能体公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
Google DeepMind 发布 Gemini 3.7 Flash,间隔三周即迭代,主打编程与智能体,输入输出价格较 3.6 减半,关乎模型竞争与开发者成本。
Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge 80
Tags:
大模型长上下文研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出“信息充裕悖论”:长上下文训练虽提升语境能力,却削弱模型参数化知识,超最优窗口后性能下降。对长上下文扩展方向提出重要警示。
Large Language Models Reproduce Racial Stereotypes When Used for Text Annotation 80
Tags:
AI安全模型偏见研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究覆盖19个LLM、400万次标注判断,发现文本中的种族身份线索使模型系统性地产生刻板印象偏差,影响自动标注在学术、审核、招聘等场景的应用,凸显AI公平性风险。
ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents 80
Tags:
AI安全智能体论文Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文提出ToolHazard,可扩展合成对抗环境框架,用于评估和提升LLM智能体对间接提示注入的防御能力,实验显示智能体普遍存在漏洞,并可用生成数据提升安全性。
Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed 78
Tags:
产品发布推理优化OpenAISource:
OpenAI News| 阅读原文
[摘要]
OpenAI预览Ultrafast模式,基于Cerebras硬件,使GPT-5.6 Sol推理速度提升至14倍,输出速率达750 token/s,显著提升API性能。
DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验 78
Tags:
大模型模型发布Source:
AI HOT 精选| 阅读原文
[摘要]
DeepSeek V4 Pro正式版与Grok 4.6同日发布,参数规模均超1.5T,逼近Claude Fable 5体验,标志两大前沿模型同日竞争,值得关注。
The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance 78
Tags:
大模型基准评估研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
IBM研究揭示LLM基准测试对题目措辞高度敏感,模型越强因措辞变化丢分越多,基准分数可靠性受挑战。
Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models 78
Tags:
推理优化大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Ripple-Pivot Search,一种免训练的扩散大语言模型并行解码方法,利用中点位置的涟漪效应加速推理,实现4-10倍加速,结合KV缓存最高18倍,且保持生成质量。
QV-PIC: Query-Aware Visual Position-Independent Caching for Efficient RAG Serving 78
Tags:
推理优化RAG大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
QV-PIC 提出查询感知的视觉位置无关缓存框架,用于高效 RAG 服务,通过双分辨率图文复用提升质量并显著降低首 token 延迟,较全预填充 TTFT 降低 83.8%。
A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench 78
Tags:
RAG医疗AI模型评测大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
专为印度及中低收入地区构建的临床RAG系统VITA在HealthBench上以51.9%得分超越GPT-5.4等前沿大模型,但在新模型和中性裁判评测下优势收窄至持平,表明语料特异性可提升落地能力。
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence 78
Tags:
智能体AI安全模型解读研究发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
介绍Mechanist智能体系统,将AI作为科学仪器自动发现模型工作机制,可生成假设并执行实验,用于解释和控制AI,提升性能与安全性。
Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs 76
Tags:
AI安全大模型对抗攻击Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究揭示大模型易被针对性说服攻击误导,强化学习训练的说服者可将单一交互说服成功率从24%提升至93%以上,并跨模型转移,GPT-4o-mini也有25%攻击成功率,凸显对抗说服鲁棒性对多智能体系统安全的重要性。
MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型 75
Tags:
模型发布开源生态音乐生成产品发布Source:
AI HOT 精选| 阅读原文
[摘要]
MiniMax发布Music 3.0,新一代开源权重音乐生成模型,支持根据概念和歌词一次性完成整首歌的作曲、编曲与制作,最长五分钟,提升音乐创作效率。
DeepSeek Harness v0.1 开发者预览版发布 75
Tags:
开源生态智能体开发者工具公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
DeepSeek 发布 Harness v0.1 开发者预览版,基于 Cordis 元框架、以 MIT 许可证开源,主打“一切皆插件”的智能体框架,组件可自由组合替换,具备生态影响力。
Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling 75
Tags:
大模型训练方法推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
该研究通过测试时扩展视角分析在线策略蒸馏(OPD),发现OPD主要提升采样效率而非真正扩展学生模型的推理能力边界,对LLM后训练方法有重要启示。
Self-Evolving Embodied Agents via Skill-Harness Evolution 75
Tags:
智能体具身智能模型发布研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出SHAPER框架,通过进化技能与环境回滚实现免训练具身智能体自我进化,在VLABench和ESI-Bench上验证有效性,为动态环境适配提供新路径。
ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering 75
Tags:
AI研究医疗AI强化学习大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究ConRub-Med提出基于共识评分规则的强化学习方法,提升开放式医学问答表现,在多个医学基准上超越现有模型,并构建了5166条评分数据集。
HarmThoughts: A Benchmark for Fine-Grained Harmful Behavior Detection in Reasoning Traces 75
Tags:
AI安全基准评测推理模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准HarmThoughts用于评估推理模型在推理痕迹中逐步产生有害行为的细粒度检测,覆盖16类推理行为、5.7万句标注,揭示现有安全监控在细粒度上的不足并验证微调的可学习性。
Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers 75
Tags:
模型研究推理优化大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究循环深度Transformer在单次前向传播中组合知识进行隐式推理,发现可系统泛化,且通过增加推理时循环实现深度外推,揭示三阶段grokking过程。