2026-08-04
Qwen发布迄今最强模型Qwen3.8-Max,2.4T参数(95B激活),首次开源Max级权重,开放权重下周发布。作为开源编码与协作模型的重要里程碑,将显著推动开源生态与AI应用发展。 欧盟《人工智能法案》透明度规则8月2日生效,强制披露AI互动内容并标注合成音视频,违者最高罚1500万欧元或全球年营业额3%,影响所有AI服务提供商。 微软开源Orchar…
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数 90
Tags:
模型发布开源生态大模型Source:
AI HOT 精选| 阅读原文
[摘要]
Qwen发布迄今最强模型Qwen3.8-Max,2.4T参数(95B激活),首次开源Max级权重,开放权重下周发布。作为开源编码与协作模型的重要里程碑,将显著推动开源生态与AI应用发展。
欧盟《人工智能法案》透明度规则生效,违规最高罚 1500 万欧元 85
Tags:
政策监管AI安全欧盟Source:
AI HOT 精选| 阅读原文
[摘要]
欧盟《人工智能法案》透明度规则8月2日生效,强制披露AI互动内容并标注合成音视频,违者最高罚1500万欧元或全球年营业额3%,影响所有AI服务提供商。
微软开源 Orchard 智能体训练框架 80
Tags:
智能体开源生态框架发布Source:
AI HOT 精选| 阅读原文
[摘要]
微软开源Orchard框架,用于跨任务训练和评估AI智能体,降低复杂性且支持小模型实现强劲性能,利好智能体研究社区。
WaiT for the Signal: Simple Frequency-Aware Flow-Matching 80
Tags:
研究进展图像生成视频生成扩散模型Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
提出频率感知的Flow-Matching图像生成方法WaiT,通过小波分解将生成分为粗细节,在ImageNet 512上达到像素空间SOTA FID 1.3,并显著降低采样计算,还可推广到视频生成。
Learning Latent Reasoning Traces for Scalar Reward Models End-to-End 80
Tags:
奖励模型RLHF大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文提出LatentRM奖励模型框架,将中间推理轨迹作为离散隐变量端到端优化,兼顾标量奖励的数值精度与生成式推理的鲁棒性,在分布内外及RLHF上优于现有方法。
TokTier: Exact Stateful Tokenization for Agentic LLM Serving 80
Tags:
推理优化智能体大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文提出TokTier状态化分词服务,在智能体场景下通过窗口重分词与GPU全量分词,使TTFT中位数下降16-34%,加速最高达491倍,代码智能体推理基础设施的重要优化。
AirLLM 实现单块 4GB GPU 运行 70B 模型推理 75
Tags:
开源生态推理优化大模型Source:
AI HOT 精选| 阅读原文
[摘要]
开源项目AirLLM实现单块4GB显存GPU运行70B大模型推理,无需多卡配置,显著降低大模型推理门槛,已获社区关注。
Google Agent Skills 幕后:如何构建、测试与规模化 75
Tags:
开源生态智能体工程实践Source:
AI HOT 精选| 阅读原文
[摘要]
Google 团队详解 Agent Skills 开源技能库的构建与治理:通过标准化目录、CI/CD 流水线和持续评估保障质量,GitHub 星标已超1.5万,对智能体开发实践有参考价值。
Cloudflare 推出 @cloudflare/computer 预览版:为智能体提供虚拟文件系统与多执行环境 75
Tags:
智能体开源生态产品发布Source:
AI HOT 精选| 阅读原文
[摘要]
Cloudflare发布开源智能体运行时@cloudflare/computer预览版,提供虚拟文件系统与多执行环境,支持隔离、容器沙箱和浏览器运行,为智能体开发带来新基础设施。
商汤发布 SenseNova U1.5-Lite-Preview 开源模型 75
Tags:
模型发布开源生态多模态Source:
AI HOT 精选| 阅读原文
[摘要]
商汤发布开源多模态模型SenseNova U1.5-Lite-Preview,基于NEO-Unify架构,仅8B-MoT参数即可达到商业闭源模型的生成与编辑质量,开源生态再添有力成员。
Zero-Mem: Zero-Token Memory Operations for LLM Agents 75
Tags:
智能体推理优化研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出 Zero-Mem,实现 LLM 智能体记忆操作的零 token 开销,无需额外 LLM 调用,在长记忆问答基准上性能相当且记忆操作时间成本降低 57.6%。
ThinkReset: Learnable Intermediate Interface Construction for Bounded-Context Long-Horizon Reasoning 75
Tags:
推理优化大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出 ThinkReset 方法,利用可复用中间接口与重置机制,缓解长链推理的上下文溢出和错误锚定,在多个长程推理基准上提升固定上下文窗口下的成功率。
Orchard: An open framework for scalable agentic AI 72
Tags:
智能体开源框架微软Source:
Microsoft Research - AI| 阅读原文
[摘要]
微软研究院发布开源框架 Orchard,用于训练和评估各类 AI 智能体,支持小模型并允许复用基础设施,降低智能体开发复杂度,值得研究社区关注。
TerraNova: A Foundation Model for the Anthropocene 72
Tags:
模型发布多模态基础模型Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
TerraNova 发布,一个训练于1024个地球物理与社会记录的基础模型,可同时建模地球与社会系统,支持多模态推理与稀疏观测重建,具有广泛研究价值。
Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning 72
Tags:
大模型推理优化AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出CaRL方法,通过奖励塑形与事后拒绝增强对齐LLM能力边界,显著减少超能力任务的无效推理,同时保持性能。
M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models 72
Tags:
评测基准语音对话多模态Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出M3-DuplexBench,一个多轮、多语言、多领域的全双工口语对话模型评测基准,支持英日双语并分析对话上下文影响,为语音交互研究提供新标准。
Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models 72
Tags:
推理优化大模型研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Mixture-of-Translators框架,可将源大模型的KV缓存翻译到目标模型,实现跨异构LLM的缓存复用,提升多模型推理和长上下文生成的效率,在QA和多智能体场景中验证了有效性。
Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation 72
Tags:
开源生态数据生成函数调用智能体Source:
arXiv Computation and Language| 阅读原文
[摘要]
Data Turnstile是开源函数调用数据生成框架,通过约束式逐步生成和验证反馈,为小模型生成高质量合成训练数据,显著提升其在函数调用和智能体任务上的表现,并附带1000+API、10万+多轮对话数据集。
ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation 72
Tags:
AI安全数据集基准测试Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准ARB揭示AI文本检测器在人类文本被大模型改写后性能大幅下降(最多跌60-78个百分点),说明传统评测无法反映真实场景,对AI检测安全有重要参考价值。
TransMem: Transforming Hidden States into Memory for Large Language Models 72
Tags:
大模型智能体推理优化研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
TransMem提出轻量级推理时参数记忆模块,将LLM历史隐藏状态转化为可复用记忆,在不重复编码上下文的情况下提升长上下文智能体性能,LoCoMo上F1提升11.58-29.25。