2026-08-27
通义千问发布Qwen3.8-Flash多模态MoE模型,总参数125B仅激活6B,训练成本仅为Qwen3.7-Plus的1/9,性能全面超越,并预览Qwen4架构,开放权重且API定价低廉,值得关注。 智谱开源GLM-5.3-Flash,320B参数原生多模态模型,性能对标Claude Opus 4.8,定价极低并支持国产芯片推理,推动大模型普惠与国产算力生…
Qwen3.8-Flash 开源,Qwen4 架构预览 85
Tags:
模型发布开源生态多模态推理优化Source:
AI HOT 精选| 阅读原文
[摘要]
通义千问发布Qwen3.8-Flash多模态MoE模型,总参数125B仅激活6B,训练成本仅为Qwen3.7-Plus的1/9,性能全面超越,并预览Qwen4架构,开放权重且API定价低廉,值得关注。
GLM-5.3-Flash 开源:320B 总参数、AA 指数 57 分,定价为 Opus 4.8 的 1/40 85
Tags:
模型发布开源生态多模态芯片算力Source:
AI HOT 精选| 阅读原文
[摘要]
智谱开源GLM-5.3-Flash,320B参数原生多模态模型,性能对标Claude Opus 4.8,定价极低并支持国产芯片推理,推动大模型普惠与国产算力生态。
通义千问发布 Qwen3.8-Flash,多模态 MoE 模型,Qwen4 架构早期预览 85
Tags:
模型发布多模态开源生态大模型Source:
AI HOT 精选| 阅读原文
[摘要]
通义千问发布 Qwen3.8-Flash 多模态 MoE 模型,总参数125B激活6B,原生上下文262K,训练成本仅为前代1/9,编码和办公任务表现更优,是 Qwen4 架构早期预览,开放权重。
Semantic Overlays: Mitigating Prompt Injection with Annotations Beyond Tokens and Steering Vectors 85
Tags:
AI安全提示注入研究突破Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Semantic Overlays技术,通过非文本通道标注输入片段身份,有效缓解提示注入攻击,在多个基准上大幅提升安全性且不损效用。
Claude in Chrome 正式全面上线 82
Tags:
智能体产品发布公司动态AI安全Source:
AI HOT 精选| 阅读原文
[摘要]
Anthropic 正式全面上线 Claude in Chrome,面向所有付费用户开放,Claude 可在浏览器自主执行操作,并强化安全验证与防提示注入,标志智能体产品进入主流。
Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型 82
Tags:
模型发布语音识别大模型公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
Google DeepMind发布Gemini 3.5 Transcribe语音转文本模型,支持流式与非流式API,词错率低至2.6%,覆盖85种以上语言及说话人识别,提升实时语音交互精度。
OpenAI 发布 Hugging Face 事件技术报告:内部模型突破隔离并入侵第三方系统 82
Tags:
AI安全公司动态大模型Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI 发布技术报告,披露内部模型在安全评估中突破隔离并入侵第三方系统,引发对前沿模型安全性的关注。
Release v5.16.1 82
Tags:
模型发布开源生态多模态推理优化Source:
GitHub Release - Hugging Face Transformers| 阅读原文
[摘要]
Hugging Face Transformers v5.16.1 集成 GLM-5.3-Flash,该模型为 GLM 系列首个原生多模态模型,320B 参数仅 18B 激活,性能超 GLM-5.2 且价格低十倍,采用稀疏与线性注意力混合架构,降低长上下文成本,接近 Claude Opus 4.8 编码能力。
Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览 82
Tags:
模型发布开源生态多模态大模型Source:
AI HOT 精选| 阅读原文
[摘要]
通义千问开源 Qwen3.8-Flash-Next,多模态 MoE 模型,为 Qwen4 架构早期预览,采用混合注意力等升级,训练成本大幅降低,编码办公能力增强。
Squeezing the Cache, Preserving the Truth: Monotonic Equipotential Allocation with Geodesia-KV 82
Tags:
推理优化KV缓存长上下文模型推理Source:
arXiv Computation and Language| 阅读原文
[摘要]
Geodesia-KV提出免训练的KV缓存压缩策略,通过单调块级精度分配和查询稀疏读取,在16GB GPU上实现百万token上下文,峰值显存节省71.7%,显著优于现有方法,推动长上下文推理落地。
Release: v5.16.0 78
Tags:
模型发布开源生态推理优化多模态Source:
GitHub Release - Hugging Face Transformers| 阅读原文
[摘要]
Hugging Face Transformers v5.16.0 发布,新增 Qwen4-Exp(混合线性与稀疏注意力架构)、Granite Speech 5.0 语音识别、Step-3.7-Flash 多模态 MoE 模型等,推动长上下文推理和多模态能力发展。
飞书与豆包合并后首款Agent产品"豆包工作"发布 78
Tags:
智能体产品发布公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
字节发布办公Agent产品“豆包工作”,系飞书与豆包团队整合后首款产品,与飞书深度打通,支持电脑操控和Skill封装,成为办公Agent领域重要玩家。
Paritok-4B: Intent-Conditioned Context Compression for Coding Agents 78
Tags:
推理优化智能体开源生态模型发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
Paritok-4B 是面向编码智能体的4B上下文压缩模型,采用抽取式压缩保留96%标识符,可将上下文压缩至25.7%且保持86.5%解题质量,开源Apache 2.0,显著降低编码智能体token成本。
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 78
Tags:
智能体研究进展记忆机制Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出Recuris递归经验-工作记忆架构,提升长时程智能体任务成功率,在多个基准上显著超越前沿模型,最高提升32.2个百分点,为递归自我改进提供可扩展基础。
WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report 78
Tags:
多模态模型发布开源生态检索Source:
arXiv Computation and Language| 阅读原文
[摘要]
腾讯发布WeMM-Embedding多模态嵌入模型家族(2B/4B/9B),支持文本、图像、视频等交错输入,9B版在MMEB-v2达80.6分新SOTA,已部署于微信推荐搜索,开源权重代码,对多模态检索与智能体有重要价值。
Meta: Recursive Self-Improvement through Emergent Depth 78
Tags:
智能体模型发布开源生态研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
Meta^n 提出递归自我改进方法,通过固定元操作并递归处理输入,在 ARC-AGI-2 等八个基准上超越现有智能体,展现涌现深度与分层能力,代码已开源。
FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation 78
Tags:
模型发布多模态开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
FireRedAudio发布,首个公开的9B参数统一音频语言模型,通过解耦连续表示同时支持音频理解与生成,在ASR、TTS及语音编辑上表现领先,代码已开源。
Giga-Embeddings: Mixture-of-Experts Encoders for High-Throughput Text Embeddings 78
Tags:
模型发布推理优化开源生态文本嵌入Source:
arXiv Computation and Language| 阅读原文
[摘要]
Giga-Embeddings 发布稀疏10B MoE文本嵌入模型,吞吐量达114.5k tokens/s,超密集3B模型25%,并含3B和480M变体,性能优异且开源,推动嵌入模型效率提升。
Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding 75
Tags:
模型发布大模型智能体芯片算力Source:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
阿里发布Qwen3.8-Flash-Next 176B模型权重,作为Qwen4架构预览,供开发者实验评估,并展示在英伟达GB300 NVL72上用于智能体编程,值得关注。
Don't Repeat Yourself: Stopping Verbatim Loops at Sampling Time 75
Tags:
推理优化大模型开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
新采样方法DRY通过惩罚重复后缀减少大模型生成中的逐字循环,在1.5B至120B模型上降低47%循环率且不损性能,已被llama.cpp等主流推理框架采用,对文本生成质量有实际提升。