Skip to content

2026-07-25

Anthropic发布Claude Opus 5,性能接近Fable 5,基准评分大幅领先,价格减半,即日起成为Claude Max默认模型。 Anthropic推出Claude Opus 5模型,性能接近顶级Fable 5但价格减半,在编程和知识任务上达到新SOTA,作为Claude Max默认模型发布。 Black Forest Labs发布多模态基础模…

Anthropic 发布 Claude Opus 5 88

  • Tags: 模型发布 大模型 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic发布Claude Opus 5,性能接近Fable 5,基准评分大幅领先,价格减半,即日起成为Claude Max默认模型。


Introducing Claude Opus 5 85

  • Tags: 模型发布 大模型 Anthropic 性能提升

  • Source: Anthropic News | 阅读原文

[摘要]
Anthropic推出Claude Opus 5模型,性能接近顶级Fable 5但价格减半,在编程和知识任务上达到新SOTA,作为Claude Max默认模型发布。


FLUX 3 x mimic:新一代视频动作模型 85

  • Tags: 模型发布 多模态 机器人 产业应用

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Black Forest Labs发布多模态基础模型FLUX 3,联合训练图像、视频和音频,并与机器人公司mimic合作推出FLUX-mimic,已在奥迪生产线测试,实现视频生成与动作预测的融合。


Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频 85

  • Tags: 模型发布 多模态 视频生成 音频生成

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Black Forest Labs 推出 FLUX 3 多模态基础模型,统一架构联合学习图像、视频与音频,支持单次生成20秒视频并附带原生音频,为多模态生成领域重要进展。


Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context 85

  • Tags: 推理优化 大模型 技术论文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Windowed-MTP通过滑动窗口限制MTP草稿头的注意力范围,降低百万级上下文推理成本28%-44%,且保持精度无损,为长上下文推理优化提供新方案。


Is MoE Routing a Huffman Code? Discovering the Frequency-Diversity Law in Chain-of-Thought 85

  • Tags: 模型架构 推理优化 MoE 信息论

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
揭示MoE路由本质是哈夫曼编码,提出频率多样性定律,发现负载均衡导致功能冗余,并提出子集差异剪枝以提升推理效率。


Moir: Let the Model Direct Its Own Story for Robust Cross-Domain Knowledge Editing 85

  • Tags: 知识编辑 模型能力保持 研究突破

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Moir方法,通过模型自身解码分布估计协方差来指导知识编辑,无需外部数据,显著减少编辑后数学推理能力下降,Qwen3-8B保留79.9% GSM8K。


LinearARD: Linear-Memory Attention Distillation for RoPE Restoration 82

  • Tags: 大模型 推理优化 模型训练

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
LinearARD提出线性内存自蒸馏方法,仅用4.25M tokens恢复LLaMA2-7B扩至32K上下文后的短文本性能98.3%,并超越长上下文基线,大幅降低训练成本。


英伟达、微软和Meta联合警告:应避免对开放权重模型过度监管 80

  • Tags: 公司动态 政策监管 开源生态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
英伟达、微软和Meta联合签署公开信,警告对开放权重AI模型过度监管将削弱美国AI竞争力,强调促进创新与学术研究。


Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80% 80

  • Tags: 大模型 推理优化 工程实践

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic 为 Claude 5 代模型大幅精简 Claude Code 系统提示词超 80%,编码评测性能无损失,提升模型效率与工程实践。


蚂蚁百灵发布Ling-3.0-flash原生混合推理模型 80

  • Tags: 模型发布 大模型 推理优化 MoE

  • Source: AI HOT 精选 | 阅读原文

[摘要]
蚂蚁百灵发布Ling-3.0-flash原生混合推理模型,124B总参数量仅5.1B激活,采用原生混合线性注意力架构与稀疏MoE,长输入TTFT降低60%-80%,性能对标旗舰模型。


Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因 80

  • Tags: 模型评测 AI安全 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
英国AI安全评测显示Kimi K3在ExploitBench得分32.2%,远低于美国前沿模型的76.2%,知识蒸馏可能解释差距。


When Does Recurrence Become an Algorithm? Convergence Selection in Weight-Tied Looped Transformers 80

  • Tags: AI研究 Transformer 算法与理论

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
权重绑定循环Transformer何时实现算法的理论研究,发现预算定律、架构先验等机制,揭示计算前沿与训练合同关系,对理解模型内部计算有深远意义。


OpenForgeRL: Train Harness-native Agents in Any Environment 80

  • Tags: 智能体 开源框架 训练方法 强化学习

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
OpenForgeRL 开源框架支持在任意环境中端到端训练基于 harness 的 AI agent,使用轻量代理和 Kubernetes 实现分布式强化学习,在多项 GUI 和工具任务中超越同类开源方案,显著提升 agent 可靠性与工具覆盖率。


The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning 80

  • Tags: AI研究 推理优化 模型训练 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究通过国际象棋潜在推理实验发现,强化学习增强的是权重稳健性而非对思考内容的依赖,挑战了潜在推理作为内部暂存区的假设。


GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries 80

  • Tags: 模型量化 训练优化 LLM

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
GaugeQuant利用LLM内部连续对称性,在训练中在线学习最优量化基,无需校准数据,显著降低低比特量化后困惑度,如LLaMA-2 7B W4A4从8.22降至6.73,对模型部署有实用价值。


VibeVoice-ASR-BitNet Technical Report 80

  • Tags: 推理优化 模型压缩 ASR 边缘部署

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
VibeVoice-ASR-BitNet 发布技术报告,通过异构量化与 BitNet 三值权重实现边缘 CPU 实时 ASR,速度比 Whisper.cpp 提升1.6-2.3倍,精度损失小。


Simple Policy Gradients for Reasoning with Diffusion Language Models 80

  • Tags: 大模型 推理优化 研究突破

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出AGRPO算法,用于扩散语言模型的强化学习后训练,在数学推理任务上准确率提升超59%,显著优于现有方法。


Understanding and Accelerating the Training of Masked Diffusion Language Models 80

  • Tags: 训练优化 扩散模型 语言模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
掩码扩散语言模型训练慢源于语言位置偏差,提出钟形时间采样策略可实现高达4倍加速,保持性能。


ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues 80

  • Tags: AI安全 大模型 评测基准 偏见

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准ImplicitBBQ通过特征线索检测大模型隐性偏见,发现隐形偏见比显性偏见高6倍以上,现有对齐策略效果有限。