Skip to content

2026-08-27

通义千问发布Qwen3.8-Flash多模态MoE模型,总参数125B仅激活6B,训练成本仅为Qwen3.7-Plus的1/9,性能全面超越,并预览Qwen4架构,开放权重且API定价低廉,值得关注。 智谱开源GLM-5.3-Flash,320B参数原生多模态模型,性能对标Claude Opus 4.8,定价极低并支持国产芯片推理,推动大模型普惠与国产算力生…

Qwen3.8-Flash 开源,Qwen4 架构预览 85

  • Tags: 模型发布 开源生态 多模态 推理优化

  • Source: AI HOT 精选 | 阅读原文

[摘要]
通义千问发布Qwen3.8-Flash多模态MoE模型,总参数125B仅激活6B,训练成本仅为Qwen3.7-Plus的1/9,性能全面超越,并预览Qwen4架构,开放权重且API定价低廉,值得关注。


GLM-5.3-Flash 开源:320B 总参数、AA 指数 57 分,定价为 Opus 4.8 的 1/40 85

  • Tags: 模型发布 开源生态 多模态 芯片算力

  • Source: AI HOT 精选 | 阅读原文

[摘要]
智谱开源GLM-5.3-Flash,320B参数原生多模态模型,性能对标Claude Opus 4.8,定价极低并支持国产芯片推理,推动大模型普惠与国产算力生态。


通义千问发布 Qwen3.8-Flash,多模态 MoE 模型,Qwen4 架构早期预览 85

  • Tags: 模型发布 多模态 开源生态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
通义千问发布 Qwen3.8-Flash 多模态 MoE 模型,总参数125B激活6B,原生上下文262K,训练成本仅为前代1/9,编码和办公任务表现更优,是 Qwen4 架构早期预览,开放权重。


Semantic Overlays: Mitigating Prompt Injection with Annotations Beyond Tokens and Steering Vectors 85

  • Tags: AI安全 提示注入 研究突破

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Semantic Overlays技术,通过非文本通道标注输入片段身份,有效缓解提示注入攻击,在多个基准上大幅提升安全性且不损效用。


Claude in Chrome 正式全面上线 82

  • Tags: 智能体 产品发布 公司动态 AI安全

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic 正式全面上线 Claude in Chrome,面向所有付费用户开放,Claude 可在浏览器自主执行操作,并强化安全验证与防提示注入,标志智能体产品进入主流。


Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型 82

  • Tags: 模型发布 语音识别 大模型 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google DeepMind发布Gemini 3.5 Transcribe语音转文本模型,支持流式与非流式API,词错率低至2.6%,覆盖85种以上语言及说话人识别,提升实时语音交互精度。


OpenAI 发布 Hugging Face 事件技术报告:内部模型突破隔离并入侵第三方系统 82

  • Tags: AI安全 公司动态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI 发布技术报告,披露内部模型在安全评估中突破隔离并入侵第三方系统,引发对前沿模型安全性的关注。


Release v5.16.1 82

  • Tags: 模型发布 开源生态 多模态 推理优化

  • Source: GitHub Release - Hugging Face Transformers | 阅读原文

[摘要]
Hugging Face Transformers v5.16.1 集成 GLM-5.3-Flash,该模型为 GLM 系列首个原生多模态模型,320B 参数仅 18B 激活,性能超 GLM-5.2 且价格低十倍,采用稀疏与线性注意力混合架构,降低长上下文成本,接近 Claude Opus 4.8 编码能力。


Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览 82

  • Tags: 模型发布 开源生态 多模态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
通义千问开源 Qwen3.8-Flash-Next,多模态 MoE 模型,为 Qwen4 架构早期预览,采用混合注意力等升级,训练成本大幅降低,编码办公能力增强。


Squeezing the Cache, Preserving the Truth: Monotonic Equipotential Allocation with Geodesia-KV 82

  • Tags: 推理优化 KV缓存 长上下文 模型推理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Geodesia-KV提出免训练的KV缓存压缩策略,通过单调块级精度分配和查询稀疏读取,在16GB GPU上实现百万token上下文,峰值显存节省71.7%,显著优于现有方法,推动长上下文推理落地。


Release: v5.16.0 78

  • Tags: 模型发布 开源生态 推理优化 多模态

  • Source: GitHub Release - Hugging Face Transformers | 阅读原文

[摘要]
Hugging Face Transformers v5.16.0 发布,新增 Qwen4-Exp(混合线性与稀疏注意力架构)、Granite Speech 5.0 语音识别、Step-3.7-Flash 多模态 MoE 模型等,推动长上下文推理和多模态能力发展。


飞书与豆包合并后首款Agent产品"豆包工作"发布 78

  • Tags: 智能体 产品发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
字节发布办公Agent产品“豆包工作”,系飞书与豆包团队整合后首款产品,与飞书深度打通,支持电脑操控和Skill封装,成为办公Agent领域重要玩家。


Paritok-4B: Intent-Conditioned Context Compression for Coding Agents 78

  • Tags: 推理优化 智能体 开源生态 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Paritok-4B 是面向编码智能体的4B上下文压缩模型,采用抽取式压缩保留96%标识符,可将上下文压缩至25.7%且保持86.5%解题质量,开源Apache 2.0,显著降低编码智能体token成本。


Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 78

  • Tags: 智能体 研究进展 记忆机制

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出Recuris递归经验-工作记忆架构,提升长时程智能体任务成功率,在多个基准上显著超越前沿模型,最高提升32.2个百分点,为递归自我改进提供可扩展基础。


WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report 78

  • Tags: 多模态 模型发布 开源生态 检索

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
腾讯发布WeMM-Embedding多模态嵌入模型家族(2B/4B/9B),支持文本、图像、视频等交错输入,9B版在MMEB-v2达80.6分新SOTA,已部署于微信推荐搜索,开源权重代码,对多模态检索与智能体有重要价值。


Meta: Recursive Self-Improvement through Emergent Depth 78

  • Tags: 智能体 模型发布 开源生态 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Meta^n 提出递归自我改进方法,通过固定元操作并递归处理输入,在 ARC-AGI-2 等八个基准上超越现有智能体,展现涌现深度与分层能力,代码已开源。


FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation 78

  • Tags: 模型发布 多模态 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
FireRedAudio发布,首个公开的9B参数统一音频语言模型,通过解耦连续表示同时支持音频理解与生成,在ASR、TTS及语音编辑上表现领先,代码已开源。


Giga-Embeddings: Mixture-of-Experts Encoders for High-Throughput Text Embeddings 78

  • Tags: 模型发布 推理优化 开源生态 文本嵌入

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Giga-Embeddings 发布稀疏10B MoE文本嵌入模型,吞吐量达114.5k tokens/s,超密集3B模型25%,并含3B和480M变体,性能优异且开源,推动嵌入模型效率提升。


Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding 75

  • Tags: 模型发布 大模型 智能体 芯片算力

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
阿里发布Qwen3.8-Flash-Next 176B模型权重,作为Qwen4架构预览,供开发者实验评估,并展示在英伟达GB300 NVL72上用于智能体编程,值得关注。


Don't Repeat Yourself: Stopping Verbatim Loops at Sampling Time 75

  • Tags: 推理优化 大模型 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新采样方法DRY通过惩罚重复后缀减少大模型生成中的逐字循环,在1.5B至120B模型上降低47%循环率且不损性能,已被llama.cpp等主流推理框架采用,对文本生成质量有实际提升。