Skip to content

2026-08-05

MiniMax 开源新一代通用全模态模型 H3,支持文本、图像、视频与音频统一理解与生成,可输出 2K 分辨率、15 秒带 32kHz 原生立体声的视频,属于重要的开源多模态生成进展。 新研究提出Bole系统,通过树投机解码为混合注意力大模型实现高效并行解码,最高提升离线解码吞吐4.72倍,并显著降低在线智能体场景时延。 提出端到端FP8训练方案,支持持续预…

MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声 85

  • Tags: 模型发布 开源生态 多模态生成

  • Source: AI HOT 精选 | 阅读原文

[摘要]
MiniMax 开源新一代通用全模态模型 H3,支持文本、图像、视频与音频统一理解与生成,可输出 2K 分辨率、15 秒带 32kHz 原生立体声的视频,属于重要的开源多模态生成进展。


Bole: Efficient Tree Speculation for Hybrid-Attention Language Models 85

  • Tags: 推理优化 大模型 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出Bole系统,通过树投机解码为混合注意力大模型实现高效并行解码,最高提升离线解码吞吐4.72倍,并显著降低在线智能体场景时延。


A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models 85

  • Tags: 训练优化 FP8 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出端到端FP8训练方案,支持持续预训练与微调,在160B token上接近BF16性能,训练时间减22%、峰值内存降14%、吞吐提升19%,可降低大模型训练成本。


Qwen-CUA: Native Computer Use for (almost) Everything 85

  • Tags: 模型发布 智能体 多模态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
阿里发布Qwen-CUA系列原生计算机使用智能体,仅凭截图和键鼠操作即可控制软件,在OSWorld等基准上表现优异,并支持超万亿参数版本,推动通用Agent发展。


Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving 85

  • Tags: 数学推理 智能体 大模型 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
上海AI实验室等提出Intern-S1-MO长时程数学推理智能体,多轮分层推理并在IMO2025非几何题获26/35分,达银牌水平,CMO2025获金牌级成绩。


Anthropic 与 Volta Infra 签 100 亿美元算力协议 82

  • Tags: 公司动态 芯片算力

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic与新型neocloud公司Volta Infra签署100亿美元算力协议,后者正从Bitdeer租用托管空间,体现Anthropic大幅扩充算力以支撑模型训练。


NVIDIA 开源 cuFile API,推动 GPU 直连存储 82

  • Tags: 芯片算力 开源生态 存储基础设施 GPU

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA 开源 cuFile API 及存储软件栈,实现 GPU 直连存储,微秒级延迟;Vera CPU 性能大幅领先,并联合40多家厂商推出 Storage-Next 计划,推动 GPU 存储生态发展。


Anthropic 与成立仅数月的云初创公司 Volta 签署 100 亿美元算力协议 82

  • Tags: 公司动态 芯片算力 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic与成立仅数月的云初创Volta签署100亿美元算力协议,约每年17亿美元,算力来自Bitdeer和Nvidia,凸显AGI算力争夺与交付风险。


DiffusionGemma Technical Report 82

  • Tags: 模型发布 扩散模型 推理优化 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
谷歌发布DiffusionGemma技术报告,提出基于离散扩散的开放权重语言模型,通过并行细化256个token块实现高速生成,在H100上约1500 tokens/s,并保持多模态与长上下文能力,建立速度与能力新权衡。


What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs 82

  • Tags: 多模态 模型研究 缩放定律

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出跨模型家族的多模态缩放定律,仅凭文本能力可预测视觉语言模型表现,为骨干模型选择提供量化依据。


NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型 80

  • Tags: 模型发布 开源生态 自动驾驶 英伟达

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA发布Alpamayo 2 Super开源模型,基于Cosmos 3 Super Reasoner,支持轨迹预测、因果推理等自动驾驶任务,现已开放商用。


腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别 80

  • Tags: 模型发布 语音识别 腾讯 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
腾讯混元发布新语音识别模型Hy ASR 3.0 preview,融合LLM与MoE架构,中英粤识别效果优异,支持上下文纠错和热词,已上线云API并免费开放。


LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing 80

  • Tags: 模型研究 推理优化 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出LongCat稀疏注意力(LSA),通过流式感知、跨层索引和分层索引优化长上下文模型的推理效率,支持百万token训练,并开源69B模型。


Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization 80

  • Tags: 模型量化 推理优化 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出ScaleQ-1.58,通过AYOT校准方法实现推理大模型的三值后训练量化,仅用4M校准token即可接近BitNet性能,支持至235B参数,提升数学与代码推理效率。


Syntax Without Semantics: Teaching Large Language Models to Code in an Unseen Language 80

  • Tags: 大模型 代码生成 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究引入预训练语料中不存在的编程语言PyLang,发现微调可快速学会语法但无法迁移语义能力,模型存在“实现保真度差距”,对理解LLM代码生成能力有普遍意义。


在单颗 AMD MI300X 上运行 DeepSeek V4 Flash 78

  • Tags: 推理优化 开源生态 芯片算力

  • Source: AI HOT 精选 | 阅读原文

[摘要]
开源社区发布在单颗AMD MI300X上生产运行DeepSeek-V4-Flash-0731的完整配置与补丁,不需要量化或权重卸载,实现168.6 tok/s解码和256K上下文验证,显著降低大模型推理硬件门槛。


A False Average: Chain-of-Thought Monitors Collapse Where They Are the Only Defense 78

  • Tags: AI安全 大模型 推理监控

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
该研究揭示链式思维监控存在严重漏洞:攻击者只需重写推理文本,即可将监控捕获率从95%降至11%,且攻击可跨模型迁移,引发对AI安全监控有效性的担忧。


Douyin Multimodal Embedding Model Technical Report 78

  • Tags: 多模态 模型发布 表示学习 搜索推荐

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
抖音发布多模态Embedding模型DME技术报告,两阶段训练兼顾大规模检索效率与细粒度语义,MMEB-v2取得SOTA,并已在抖音搜索等场景部署,带来线上收益。


Opt.Gear Technical Report 78

  • Tags: 模型发布 开源生态 推理优化 端侧AI

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Opt.Gear发布端侧基础模型系列,含1M、270M、1B参数,通过混合架构降低KV缓存,NPU上推理速度提升数倍,开源权重并支持ONNX、高通NPU、苹果ANE部署,还推出可跑在MCU上的1M模型。


Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models 78

  • Tags: 大模型 模型评测 AI安全 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出Self-Correction Bench评估框架,发现LLM存在64.5%自校正盲点:能修正外部错误却难以修正自身同类错误,可通过少量数据微调和提示词缓解,对AI安全有重要价值。