2026-08-13
阿里开源Qwen3.8-2.4T-A95B模型权重,总参数2.4T、激活95B的MoE模型,原生支持256K上下文,可扩展至百万级。这是Qwen-Max级别模型首次开源,对开源生态和开发者意义重大。 xAI发布Grok 4.6,强化长时运行智能体与复杂交互、视觉能力,多项基准达前沿水平,追平GPT-5.6 Sol,是重要模型更新。 Cursor 与 Spac…
阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文 92
Tags:
模型发布开源生态大模型Source:
AI HOT 精选| 阅读原文
[摘要]
阿里开源Qwen3.8-2.4T-A95B模型权重,总参数2.4T、激活95B的MoE模型,原生支持256K上下文,可扩展至百万级。这是Qwen-Max级别模型首次开源,对开源生态和开发者意义重大。
xAI 发布 Grok 4.6,强化长时运行智能体能力 88
Tags:
模型发布智能体大模型Source:
AI HOT 精选| 阅读原文
[摘要]
xAI发布Grok 4.6,强化长时运行智能体与复杂交互、视觉能力,多项基准达前沿水平,追平GPT-5.6 Sol,是重要模型更新。
Cursor 与 SpaceXAI 联合发布 Grok 4.6 85
Tags:
模型发布智能体大模型Source:
AI HOT 精选| 阅读原文
[摘要]
Cursor 与 SpaceXAI 联合发布 Grok 4.6,强化长时智能体与交互式视觉任务,多项智能体编程和知识工作基准达前沿水平,并在评估指数上追平 GPT-5.6 Sol,值得关注。
Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72 82
Tags:
模型发布开源生态芯片算力Source:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
阿里巴巴发布Qwen3.8-2.4T-A95B(Qwen3.8-Max),是其最大开源权重模型,具备接近前沿能力,并支持在NVIDIA GB300 NVL72上配置推理,对开源生态有重要影响。
微软首发自研推理模型MAI-Thinking-1 80
Tags:
模型发布大模型公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
微软发布自研推理模型MAI-Thinking-1,从零开始构建并已在Microsoft Foundry上线,标志着微软在大模型推理领域的重要布局。
Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models 80
Tags:
具身智能模型发布语言对齐Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出SALT语义对齐动作分词器,改善视觉-语言-动作模型(VLA)中动作表示与语言的对应,在SimplerEnv上成功率大幅提升,展示语言条件控制的显著改进。
空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈 78
Tags:
大模型研究基准评测Source:
AI HOT 精选| 阅读原文
[摘要]
Google Research提出知识画像框架,发现前沿LLM事实编码接近饱和但回忆能力不足,多数错误源于回忆失败而非编码缺失,并发布WikiProfile基准用于分别探测编码与回忆能力。
Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents 78
Tags:
智能体评测多语言研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究测量工具智能体跨语言行动策略保留率,发现前沿模型保留约71-73%,小模型失效,且行为依赖英语中转,对多语言智能体评测有重要意义。
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design 78
Tags:
智能体研究综述AI安全自主演化Source:
arXiv Computation and Language| 阅读原文
[摘要]
本文综述智能体系统中的共同演化机制,提出三阶段分类法,探讨智能体如何通过动态交互实现超越人类设计的自导演化,为构建开放且鲁棒的智能体系统提供基础。
Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation 78
Tags:
模型发布机器翻译开源生态训练方法Source:
arXiv Computation and Language| 阅读原文
[摘要]
开源大模型多语言翻译后训练研究:使用GRPO结合无参考质量评估,通过检查点插值提升46种语言翻译质量,超越Seed-X等开源及专有系统,并开源模型与代码。
DocAtlas: Long-Document Understanding as Mutable-State Interaction 78
Tags:
文档理解智能体检索增强模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
DocAtlas提出可变状态文档理解框架,将长文档问答建模为动态信息搜索过程,结合自改进检索与记忆,在MMLongBench-Doc上超越人类专家基线,并以端到端强化学习显著提升紧凑VLM性能,展示了文档智能体的新方向。
Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law 78
Tags:
RAG评测基准法律AI模型发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究揭示法律RAG存在时间错位问题:检索引用现行法条而非适用版本。发布法语文税法典版本化基准FiscalQA Pro及数据集,多模型仅3%准确率,专用检索器达98.3%,对法律AI有重要参考价值。
Multimodal Model Diffing for Feature Discovery and Control 78
Tags:
模型可解释性多模态AI安全研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出MMDiff框架,通过多模态稀疏自编码器实现特征隔离、检测与控制,在空间理解、OCR及安全任务上提升性能并降低攻击成功率,推动MLLM可解释性与可控性研究。
Overconfident and Blind to Details: Fixing Prompt Insensitivity with Abductive Preference Learning 76
Tags:
模型训练偏好学习视觉语言模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出溯因偏好学习方法,优化逆向策略以修正视觉语言模型对关键输入编辑不敏感的问题,在VLMBias等基准上大幅提升长尾提示准确率,较GPT-5.2等更强。
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning 76
Tags:
模型发布开源生态推理优化Source:
AI HOT 精选| 阅读原文
[摘要]
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning,该开源 MoE 模型总参数30B、激活3B,支持1M上下文及多种投机解码,可通过 OpenAI 兼容 API 接入智能体工作流。
b10369 75
Tags:
开源生态推理优化语音生成Source:
GitHub Release - llama.cpp| 阅读原文
[摘要]
llama.cpp新增对pocket-tts的支持,将转置卷积重构为GEMM+col2im,解码帧生成时间在CUDA上降低80%,CPU降低50%,输出与之前高度一致,并完善了多语言包的流式与填充参数。
Data Attribution of Emergent Misalignment with Persona Features 75
Tags:
AI安全模型对齐大模型可解释性Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究通过稀疏自编码器定位预训练中引发‘应急错位’的人格特征方向,发现仅用人类文本微调不足以诱发,但合成指令-响应对可以,揭示响应结构在安全对齐中的关键作用。
Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence 75
Tags:
多模态模型发布语音生成视频生成Source:
arXiv Computation and Language| 阅读原文
[摘要]
Ex-Omni-2D 提出全模态对话框架,能同步生成文本、个性化语音和参考条件视频,引入视觉思考计划与流式学生模型,实现高效增量推理。
DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation 75
Tags:
模型蒸馏多模态检索模型压缩效率优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出DistilVDR,用双师生蒸馏将8B视觉文档检索模型压缩至524M,性能达教师的86.9%,索引体积缩小15.6倍,显著降低部署成本。
StreamFlow: Dynamic Memory Flows for Streaming Video Understanding 75
Tags:
多模态视频理解模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
StreamFlow提出动态视觉记忆框架,用于流式视频理解,通过中期与长期记忆机制减少计算冗余,在StreamingBench达SOTA,并显著降低延迟和内存占用。