2026-07-25
Anthropic发布Claude Opus 5,性能接近Fable 5,基准评分大幅领先,价格减半,即日起成为Claude Max默认模型。 Anthropic推出Claude Opus 5模型,性能接近顶级Fable 5但价格减半,在编程和知识任务上达到新SOTA,作为Claude Max默认模型发布。 Black Forest Labs发布多模态基础模…
Anthropic 发布 Claude Opus 5 88
Tags:
模型发布大模型公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
Anthropic发布Claude Opus 5,性能接近Fable 5,基准评分大幅领先,价格减半,即日起成为Claude Max默认模型。
Introducing Claude Opus 5 85
Tags:
模型发布大模型Anthropic性能提升Source:
Anthropic News| 阅读原文
[摘要]
Anthropic推出Claude Opus 5模型,性能接近顶级Fable 5但价格减半,在编程和知识任务上达到新SOTA,作为Claude Max默认模型发布。
FLUX 3 x mimic:新一代视频动作模型 85
Tags:
模型发布多模态机器人产业应用Source:
AI HOT 精选| 阅读原文
[摘要]
Black Forest Labs发布多模态基础模型FLUX 3,联合训练图像、视频和音频,并与机器人公司mimic合作推出FLUX-mimic,已在奥迪生产线测试,实现视频生成与动作预测的融合。
Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频 85
Tags:
模型发布多模态视频生成音频生成Source:
AI HOT 精选| 阅读原文
[摘要]
Black Forest Labs 推出 FLUX 3 多模态基础模型,统一架构联合学习图像、视频与音频,支持单次生成20秒视频并附带原生音频,为多模态生成领域重要进展。
Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context 85
Tags:
推理优化大模型技术论文Source:
arXiv Computation and Language| 阅读原文
[摘要]
Windowed-MTP通过滑动窗口限制MTP草稿头的注意力范围,降低百万级上下文推理成本28%-44%,且保持精度无损,为长上下文推理优化提供新方案。
Is MoE Routing a Huffman Code? Discovering the Frequency-Diversity Law in Chain-of-Thought 85
Tags:
模型架构推理优化MoE信息论Source:
arXiv Computation and Language| 阅读原文
[摘要]
揭示MoE路由本质是哈夫曼编码,提出频率多样性定律,发现负载均衡导致功能冗余,并提出子集差异剪枝以提升推理效率。
Moir: Let the Model Direct Its Own Story for Robust Cross-Domain Knowledge Editing 85
Tags:
知识编辑模型能力保持研究突破Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Moir方法,通过模型自身解码分布估计协方差来指导知识编辑,无需外部数据,显著减少编辑后数学推理能力下降,Qwen3-8B保留79.9% GSM8K。
LinearARD: Linear-Memory Attention Distillation for RoPE Restoration 82
Tags:
大模型推理优化模型训练Source:
arXiv Computation and Language| 阅读原文
[摘要]
LinearARD提出线性内存自蒸馏方法,仅用4.25M tokens恢复LLaMA2-7B扩至32K上下文后的短文本性能98.3%,并超越长上下文基线,大幅降低训练成本。
英伟达、微软和Meta联合警告:应避免对开放权重模型过度监管 80
Tags:
公司动态政策监管开源生态Source:
AI HOT 精选| 阅读原文
[摘要]
英伟达、微软和Meta联合签署公开信,警告对开放权重AI模型过度监管将削弱美国AI竞争力,强调促进创新与学术研究。
Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80% 80
Tags:
大模型推理优化工程实践Source:
AI HOT 精选| 阅读原文
[摘要]
Anthropic 为 Claude 5 代模型大幅精简 Claude Code 系统提示词超 80%,编码评测性能无损失,提升模型效率与工程实践。
蚂蚁百灵发布Ling-3.0-flash原生混合推理模型 80
Tags:
模型发布大模型推理优化MoESource:
AI HOT 精选| 阅读原文
[摘要]
蚂蚁百灵发布Ling-3.0-flash原生混合推理模型,124B总参数量仅5.1B激活,采用原生混合线性注意力架构与稀疏MoE,长输入TTFT降低60%-80%,性能对标旗舰模型。
Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因 80
Tags:
模型评测AI安全公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
英国AI安全评测显示Kimi K3在ExploitBench得分32.2%,远低于美国前沿模型的76.2%,知识蒸馏可能解释差距。
When Does Recurrence Become an Algorithm? Convergence Selection in Weight-Tied Looped Transformers 80
Tags:
AI研究Transformer算法与理论Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
权重绑定循环Transformer何时实现算法的理论研究,发现预算定律、架构先验等机制,揭示计算前沿与训练合同关系,对理解模型内部计算有深远意义。
OpenForgeRL: Train Harness-native Agents in Any Environment 80
Tags:
智能体开源框架训练方法强化学习Source:
arXiv Computation and Language| 阅读原文
[摘要]
OpenForgeRL 开源框架支持在任意环境中端到端训练基于 harness 的 AI agent,使用轻量代理和 Kubernetes 实现分布式强化学习,在多项 GUI 和工具任务中超越同类开源方案,显著提升 agent 可靠性与工具覆盖率。
The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning 80
Tags:
AI研究推理优化模型训练AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究通过国际象棋潜在推理实验发现,强化学习增强的是权重稳健性而非对思考内容的依赖,挑战了潜在推理作为内部暂存区的假设。
GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries 80
Tags:
模型量化训练优化LLMSource:
arXiv Computation and Language| 阅读原文
[摘要]
GaugeQuant利用LLM内部连续对称性,在训练中在线学习最优量化基,无需校准数据,显著降低低比特量化后困惑度,如LLaMA-2 7B W4A4从8.22降至6.73,对模型部署有实用价值。
VibeVoice-ASR-BitNet Technical Report 80
Tags:
推理优化模型压缩ASR边缘部署Source:
arXiv Computation and Language| 阅读原文
[摘要]
VibeVoice-ASR-BitNet 发布技术报告,通过异构量化与 BitNet 三值权重实现边缘 CPU 实时 ASR,速度比 Whisper.cpp 提升1.6-2.3倍,精度损失小。
Simple Policy Gradients for Reasoning with Diffusion Language Models 80
Tags:
大模型推理优化研究突破Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出AGRPO算法,用于扩散语言模型的强化学习后训练,在数学推理任务上准确率提升超59%,显著优于现有方法。
Understanding and Accelerating the Training of Masked Diffusion Language Models 80
Tags:
训练优化扩散模型语言模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
掩码扩散语言模型训练慢源于语言位置偏差,提出钟形时间采样策略可实现高达4倍加速,保持性能。
ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues 80
Tags:
AI安全大模型评测基准偏见Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准ImplicitBBQ通过特征线索检测大模型隐性偏见,发现隐形偏见比显性偏见高6倍以上,现有对齐策略效果有限。