Skip to content

2026-08-04

Qwen发布迄今最强模型Qwen3.8-Max,2.4T参数(95B激活),首次开源Max级权重,开放权重下周发布。作为开源编码与协作模型的重要里程碑,将显著推动开源生态与AI应用发展。 欧盟《人工智能法案》透明度规则8月2日生效,强制披露AI互动内容并标注合成音视频,违者最高罚1500万欧元或全球年营业额3%,影响所有AI服务提供商。 微软开源Orchar…

Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数 90

  • Tags: 模型发布 开源生态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Qwen发布迄今最强模型Qwen3.8-Max,2.4T参数(95B激活),首次开源Max级权重,开放权重下周发布。作为开源编码与协作模型的重要里程碑,将显著推动开源生态与AI应用发展。


欧盟《人工智能法案》透明度规则生效,违规最高罚 1500 万欧元 85

  • Tags: 政策监管 AI安全 欧盟

  • Source: AI HOT 精选 | 阅读原文

[摘要]
欧盟《人工智能法案》透明度规则8月2日生效,强制披露AI互动内容并标注合成音视频,违者最高罚1500万欧元或全球年营业额3%,影响所有AI服务提供商。


微软开源 Orchard 智能体训练框架 80

  • Tags: 智能体 开源生态 框架发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
微软开源Orchard框架,用于跨任务训练和评估AI智能体,降低复杂性且支持小模型实现强劲性能,利好智能体研究社区。


WaiT for the Signal: Simple Frequency-Aware Flow-Matching 80

  • Tags: 研究进展 图像生成 视频生成 扩散模型

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出频率感知的Flow-Matching图像生成方法WaiT,通过小波分解将生成分为粗细节,在ImageNet 512上达到像素空间SOTA FID 1.3,并显著降低采样计算,还可推广到视频生成。


Learning Latent Reasoning Traces for Scalar Reward Models End-to-End 80

  • Tags: 奖励模型 RLHF 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文提出LatentRM奖励模型框架,将中间推理轨迹作为离散隐变量端到端优化,兼顾标量奖励的数值精度与生成式推理的鲁棒性,在分布内外及RLHF上优于现有方法。


TokTier: Exact Stateful Tokenization for Agentic LLM Serving 80

  • Tags: 推理优化 智能体 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文提出TokTier状态化分词服务,在智能体场景下通过窗口重分词与GPU全量分词,使TTFT中位数下降16-34%,加速最高达491倍,代码智能体推理基础设施的重要优化。


AirLLM 实现单块 4GB GPU 运行 70B 模型推理 75

  • Tags: 开源生态 推理优化 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
开源项目AirLLM实现单块4GB显存GPU运行70B大模型推理,无需多卡配置,显著降低大模型推理门槛,已获社区关注。


Google Agent Skills 幕后:如何构建、测试与规模化 75

  • Tags: 开源生态 智能体 工程实践

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google 团队详解 Agent Skills 开源技能库的构建与治理:通过标准化目录、CI/CD 流水线和持续评估保障质量,GitHub 星标已超1.5万,对智能体开发实践有参考价值。


Cloudflare 推出 @cloudflare/computer 预览版:为智能体提供虚拟文件系统与多执行环境 75

  • Tags: 智能体 开源生态 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Cloudflare发布开源智能体运行时@cloudflare/computer预览版,提供虚拟文件系统与多执行环境,支持隔离、容器沙箱和浏览器运行,为智能体开发带来新基础设施。


商汤发布 SenseNova U1.5-Lite-Preview 开源模型 75

  • Tags: 模型发布 开源生态 多模态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
商汤发布开源多模态模型SenseNova U1.5-Lite-Preview,基于NEO-Unify架构,仅8B-MoT参数即可达到商业闭源模型的生成与编辑质量,开源生态再添有力成员。


Zero-Mem: Zero-Token Memory Operations for LLM Agents 75

  • Tags: 智能体 推理优化 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出 Zero-Mem,实现 LLM 智能体记忆操作的零 token 开销,无需额外 LLM 调用,在长记忆问答基准上性能相当且记忆操作时间成本降低 57.6%。


ThinkReset: Learnable Intermediate Interface Construction for Bounded-Context Long-Horizon Reasoning 75

  • Tags: 推理优化 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 ThinkReset 方法,利用可复用中间接口与重置机制,缓解长链推理的上下文溢出和错误锚定,在多个长程推理基准上提升固定上下文窗口下的成功率。


Orchard: An open framework for scalable agentic AI 72

  • Tags: 智能体 开源框架 微软

  • Source: Microsoft Research - AI | 阅读原文

[摘要]
微软研究院发布开源框架 Orchard,用于训练和评估各类 AI 智能体,支持小模型并允许复用基础设施,降低智能体开发复杂度,值得研究社区关注。


TerraNova: A Foundation Model for the Anthropocene 72

  • Tags: 模型发布 多模态 基础模型

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
TerraNova 发布,一个训练于1024个地球物理与社会记录的基础模型,可同时建模地球与社会系统,支持多模态推理与稀疏观测重建,具有广泛研究价值。


Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning 72

  • Tags: 大模型 推理优化 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出CaRL方法,通过奖励塑形与事后拒绝增强对齐LLM能力边界,显著减少超能力任务的无效推理,同时保持性能。


M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models 72

  • Tags: 评测基准 语音对话 多模态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出M3-DuplexBench,一个多轮、多语言、多领域的全双工口语对话模型评测基准,支持英日双语并分析对话上下文影响,为语音交互研究提供新标准。


Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models 72

  • Tags: 推理优化 大模型 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Mixture-of-Translators框架,可将源大模型的KV缓存翻译到目标模型,实现跨异构LLM的缓存复用,提升多模型推理和长上下文生成的效率,在QA和多智能体场景中验证了有效性。


Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation 72

  • Tags: 开源生态 数据生成 函数调用 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Data Turnstile是开源函数调用数据生成框架,通过约束式逐步生成和验证反馈,为小模型生成高质量合成训练数据,显著提升其在函数调用和智能体任务上的表现,并附带1000+API、10万+多轮对话数据集。


ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation 72

  • Tags: AI安全 数据集 基准测试

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准ARB揭示AI文本检测器在人类文本被大模型改写后性能大幅下降(最多跌60-78个百分点),说明传统评测无法反映真实场景,对AI检测安全有重要参考价值。


TransMem: Transforming Hidden States into Memory for Large Language Models 72

  • Tags: 大模型 智能体 推理优化 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
TransMem提出轻量级推理时参数记忆模块,将LLM历史隐藏状态转化为可复用记忆,在不重复编码上下文的情况下提升长上下文智能体性能,LoCoMo上F1提升11.58-29.25。