Skip to content

2026-08-13

阿里开源Qwen3.8-2.4T-A95B模型权重,总参数2.4T、激活95B的MoE模型,原生支持256K上下文,可扩展至百万级。这是Qwen-Max级别模型首次开源,对开源生态和开发者意义重大。 xAI发布Grok 4.6,强化长时运行智能体与复杂交互、视觉能力,多项基准达前沿水平,追平GPT-5.6 Sol,是重要模型更新。 Cursor 与 Spac…

阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文 92

  • Tags: 模型发布 开源生态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
阿里开源Qwen3.8-2.4T-A95B模型权重,总参数2.4T、激活95B的MoE模型,原生支持256K上下文,可扩展至百万级。这是Qwen-Max级别模型首次开源,对开源生态和开发者意义重大。


xAI 发布 Grok 4.6,强化长时运行智能体能力 88

  • Tags: 模型发布 智能体 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
xAI发布Grok 4.6,强化长时运行智能体与复杂交互、视觉能力,多项基准达前沿水平,追平GPT-5.6 Sol,是重要模型更新。


Cursor 与 SpaceXAI 联合发布 Grok 4.6 85

  • Tags: 模型发布 智能体 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Cursor 与 SpaceXAI 联合发布 Grok 4.6,强化长时智能体与交互式视觉任务,多项智能体编程和知识工作基准达前沿水平,并在评估指数上追平 GPT-5.6 Sol,值得关注。


Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72 82

  • Tags: 模型发布 开源生态 芯片算力

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
阿里巴巴发布Qwen3.8-2.4T-A95B(Qwen3.8-Max),是其最大开源权重模型,具备接近前沿能力,并支持在NVIDIA GB300 NVL72上配置推理,对开源生态有重要影响。


微软首发自研推理模型MAI-Thinking-1 80

  • Tags: 模型发布 大模型 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
微软发布自研推理模型MAI-Thinking-1,从零开始构建并已在Microsoft Foundry上线,标志着微软在大模型推理领域的重要布局。


Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models 80

  • Tags: 具身智能 模型发布 语言对齐

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出SALT语义对齐动作分词器,改善视觉-语言-动作模型(VLA)中动作表示与语言的对应,在SimplerEnv上成功率大幅提升,展示语言条件控制的显著改进。


空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈 78

  • Tags: 大模型 研究 基准评测

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google Research提出知识画像框架,发现前沿LLM事实编码接近饱和但回忆能力不足,多数错误源于回忆失败而非编码缺失,并发布WikiProfile基准用于分别探测编码与回忆能力。


Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents 78

  • Tags: 智能体 评测 多语言 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究测量工具智能体跨语言行动策略保留率,发现前沿模型保留约71-73%,小模型失效,且行为依赖英语中转,对多语言智能体评测有重要意义。


Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design 78

  • Tags: 智能体 研究综述 AI安全 自主演化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
本文综述智能体系统中的共同演化机制,提出三阶段分类法,探讨智能体如何通过动态交互实现超越人类设计的自导演化,为构建开放且鲁棒的智能体系统提供基础。


Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation 78

  • Tags: 模型发布 机器翻译 开源生态 训练方法

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
开源大模型多语言翻译后训练研究:使用GRPO结合无参考质量评估,通过检查点插值提升46种语言翻译质量,超越Seed-X等开源及专有系统,并开源模型与代码。


DocAtlas: Long-Document Understanding as Mutable-State Interaction 78

  • Tags: 文档理解 智能体 检索增强 模型研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
DocAtlas提出可变状态文档理解框架,将长文档问答建模为动态信息搜索过程,结合自改进检索与记忆,在MMLongBench-Doc上超越人类专家基线,并以端到端强化学习显著提升紧凑VLM性能,展示了文档智能体的新方向。


  • Tags: RAG 评测基准 法律AI 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究揭示法律RAG存在时间错位问题:检索引用现行法条而非适用版本。发布法语文税法典版本化基准FiscalQA Pro及数据集,多模型仅3%准确率,专用检索器达98.3%,对法律AI有重要参考价值。


Multimodal Model Diffing for Feature Discovery and Control 78

  • Tags: 模型可解释性 多模态 AI安全 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出MMDiff框架,通过多模态稀疏自编码器实现特征隔离、检测与控制,在空间理解、OCR及安全任务上提升性能并降低攻击成功率,推动MLLM可解释性与可控性研究。


Overconfident and Blind to Details: Fixing Prompt Insensitivity with Abductive Preference Learning 76

  • Tags: 模型训练 偏好学习 视觉语言模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出溯因偏好学习方法,优化逆向策略以修正视觉语言模型对关键输入编辑不敏感的问题,在VLMBias等基准上大幅提升长尾提示准确率,较GPT-5.2等更强。


SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning 76

  • Tags: 模型发布 开源生态 推理优化

  • Source: AI HOT 精选 | 阅读原文

[摘要]
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning,该开源 MoE 模型总参数30B、激活3B,支持1M上下文及多种投机解码,可通过 OpenAI 兼容 API 接入智能体工作流。


b10369 75

  • Tags: 开源生态 推理优化 语音生成

  • Source: GitHub Release - llama.cpp | 阅读原文

[摘要]
llama.cpp新增对pocket-tts的支持,将转置卷积重构为GEMM+col2im,解码帧生成时间在CUDA上降低80%,CPU降低50%,输出与之前高度一致,并完善了多语言包的流式与填充参数。


Data Attribution of Emergent Misalignment with Persona Features 75

  • Tags: AI安全 模型对齐 大模型 可解释性

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究通过稀疏自编码器定位预训练中引发‘应急错位’的人格特征方向,发现仅用人类文本微调不足以诱发,但合成指令-响应对可以,揭示响应结构在安全对齐中的关键作用。


Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence 75

  • Tags: 多模态 模型发布 语音生成 视频生成

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Ex-Omni-2D 提出全模态对话框架,能同步生成文本、个性化语音和参考条件视频,引入视觉思考计划与流式学生模型,实现高效增量推理。


DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation 75

  • Tags: 模型蒸馏 多模态检索 模型压缩 效率优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出DistilVDR,用双师生蒸馏将8B视觉文档检索模型压缩至524M,性能达教师的86.9%,索引体积缩小15.6倍,显著降低部署成本。


StreamFlow: Dynamic Memory Flows for Streaming Video Understanding 75

  • Tags: 多模态 视频理解 模型研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
StreamFlow提出动态视觉记忆框架,用于流式视频理解,通过中期与长期记忆机制减少计算冗余,在StreamingBench达SOTA,并显著降低延迟和内存占用。