Skip to content

2026-07-08

Google DeepMind 发布 Gemma 4 技术报告,介绍新一代开放权重原生多模态模型,涵盖密集与 MoE 架构、统一无编码器架构和推理思考模式,显著提升推理、多模态与长上下文性能。 NVIDIA 发布统一音频-文本大模型 Audex,基于 MoE 架构,在音频理解、生成和语音翻译等任务上达到 SOTA,同时不损失文本推理能力,并开源模型权重。 提…

Gemma 4 Technical Report 92

  • Tags: 模型发布 大模型 多模态 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Google DeepMind 发布 Gemma 4 技术报告,介绍新一代开放权重原生多模态模型,涵盖密集与 MoE 架构、统一无编码器架构和推理思考模式,显著提升推理、多模态与长上下文性能。


Unified Audio Intelligence Without Regressing on Text Intelligence 90

  • Tags: 模型发布 多模态 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
NVIDIA 发布统一音频-文本大模型 Audex,基于 MoE 架构,在音频理解、生成和语音翻译等任务上达到 SOTA,同时不损失文本推理能力,并开源模型权重。


Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models 88

  • Tags: 模型优化 量化 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出VBQ方法,让每组权重学习1/2/4/8比特精度,实现非均匀量化,131M模型1.82平均比特下性能超过55M FP16,存储减少3.8倍,并加速推理。


NVIDIA Vera CPU Boosts AI Factory Throughput to Accelerate Agentic Workloads 85

  • Tags: 芯片算力 智能体 公司动态 AI基础设施

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
NVIDIA发布Vera CPU,提升AI工厂吞吐量,加速智能体工作负载,涵盖推理、工具使用、代码执行等关键能力。


Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models 85

  • Tags: AI安全 大模型 强化学习 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Self-RedTeam,首个在线自对弈多智能体强化学习算法,让LLM攻击者与防御者持续共进化,显著提升安全对齐,在多个模型上验证有效。


Weak-to-Strong Generalization via Direct On-Policy Distillation 85

  • Tags: 训练方法 推理优化 弱到强泛化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Direct-OPD方法,利用弱模型的RL策略偏移作为隐式奖励来提升强模型推理能力,避免在强模型上运行昂贵RL,在AIME 2024上8块A100中4小时提升Qwen3-1.7B性能14个百分点。


LLMs Encode Harmfulness and Refusal Separately 85

  • Tags: AI安全 大模型 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究发现LLM中“有害性”与“拒绝”编码为独立概念,利用有害性方向可更好检测恶意输入并减少过度拒绝,成果可用于构建鲁棒的内置安全防护。


The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models 85

  • Tags: 大模型 模型评测 AI安全 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
系统分析前沿LLM(GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro等)中口头禅现象,提出VTI指标,揭示对齐税,呼吁更真实的人机交互。


Council Mode: A Heterogeneous Multi-Agent Consensus Framework for Reducing LLM Hallucination and Bias 85

  • Tags: 多智能体 模型推理 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Council Mode多智能体共识框架,通过异构模型并行生成与结构化综合,显著降低LLM幻觉(HaluEval下降41.7%)和偏见,提升推理质量9.2分。


Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning 85

  • Tags: 研究发布 多模态 智能体 视频理解

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Homer提出分层记忆与智能体推理框架,在长视频在线理解中超越此前最佳方法,显著提升M3-Bench等基准成绩。


Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations 85

  • Tags: AI安全 研究突破 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究RetroCoT通过将有害请求伪装成法医重建任务,成功绕过GPT-4等多代模型的安全对齐,揭示语用框架而非语义意图才是对齐弱点。


Transplanting, inverting, and preventing a misalignment persona: method-conditional emergent misalignment in Qwen2.5 85

  • Tags: AI安全 对齐研究 模型行为

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示Qwen2.5模型微调后涌现失配由潜在人格方向介导,可移植、测量和预防,对AI对齐安全有重要意义。


EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments 85

  • Tags: 智能体 缩放定律 AI研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
EdgeBench提出134个真实世界任务,发现智能体环境学习遵循对数Sigmoid缩放定律,学习速度约每三个月翻倍,揭示了后部署学习的可预测性。


The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models 85

  • Tags: 智能体 推理优化 模型评测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
独立验证表明,自然语言工具(NLT)在14个模型中平均提升工具调用准确率14.9%,减少93%错误,降低25.2% token消耗,是结构化调用的实用替代方案。


Learning When to Attend: Conditional Memory Access for Long-Context LLMs 82

  • Tags: 推理优化 大模型 长上下文 开源模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出L2A条件注意力机制,使LLM高效扩展至128K上下文,跳过80%全注意力,训练吞吐量提升2倍,KV缓存减少50%,代码开源。


Intelligence is Free, Now What? <br> Data Systems for, of, and by Agents 80

  • Tags: 智能体 数据系统 趋势分析 推理成本

  • Source: Berkeley AI Research Blog | 阅读原文

[摘要]
UC Berkeley团队提出:AI推理成本急剧下降将进入近乎免费智能时代,对数据系统带来三大变革——为智能体设计、由智能体构成、由智能体合成数据系统。


Generative Pseudo-Labeling for Pre-Ranking with LLMs 80

  • Tags: 大模型 推荐系统 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出利用大语言模型为推荐系统预排序阶段生成无偏伪标签,解决训练-服务差异,在工业系统上线后CTR提升3.07%,并增强推荐多样性与长尾发现。


SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards 80

  • Tags: 多模态大模型 空间推理 强化学习 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
SpatialThinker 首次将场景图生成嵌套进视觉推理链,通过密集奖励强化学习实现强空间推理,仅7K样本即在14项基准上超越GPT-5。


FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion 80

  • Tags: 推理优化 模型发布 注意力机制 长上下文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
FlashBlock提出跨步注意力缓存机制,复用稳定的块外注意力输出,减少长上下文扩散模型的计算和缓存访问,推理吞吐量提升1.44倍,注意力时间减少1.6倍。


The Language of Bargaining: Linguistic Effects in LLM Negotiations 80

  • Tags: 大模型 模型评估 多语言 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究发现,语言选择对LLM谈判结果的影响甚至大于换模型,仅用英语评估会产生误导,呼吁采用文化感知的评估方法。