Skip to content

2026-08-11

Meta发布开源30B参数模型Muse Glimmer,专为本地常驻智能体工作流优化,可在消费级硬件运行,Apache 2.0许可,推动端侧智能体应用。 提出反事实模拟训练(CST),通过奖励能预测反事实输入的思维链,提升CoT推理的忠实度,实验显示监测准确率大幅提升,对模型可解释性和安全监控有重要价值。 OpenAI 发布网络安全专用模型 GPT-5.6-…

Meta 发布开源模型 Muse Glimmer 85

  • Tags: 模型发布 开源生态 智能体 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Meta发布开源30B参数模型Muse Glimmer,专为本地常驻智能体工作流优化,可在消费级硬件运行,Apache 2.0许可,推动端侧智能体应用。


Counterfactual Simulation Training for Chain-of-Thought Faithfulness 82

  • Tags: 大模型 推理优化 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出反事实模拟训练(CST),通过奖励能预测反事实输入的思维链,提升CoT推理的忠实度,实验显示监测准确率大幅提升,对模型可解释性和安全监控有重要价值。


OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型 80

  • Tags: 模型发布 AI安全 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,面向授权漏洞研究与安全测试,应对防御窗口收窄挑战,为安全人员提供专门工具。


Expanding Daybreak as the Cyber Defense Window Narrows 80

  • Tags: 模型发布 AI安全 产品发布

  • Source: OpenAI News | 阅读原文

[摘要]
OpenAI推出网络安全专用模型GPT-5.6-Cyber,通过Daybreak Red平台供授权漏洞研究与安全测试使用,扩展AI在攻防领域的应用。


Fast, On Device Agentic AI with Muse Glimmer on ExecuTorch 80

  • Tags: 模型发布 开源生态 智能体 边缘计算

  • Source: PyTorch Blog | 阅读原文

[摘要]
Meta发布开源模型Muse Glimmer,30B参数,专为端侧智能体工作流设计,并由ExecuTorch提供NVIDIA端到端支持,值得关注。


Run Local Agentic AI Workflows with Meta’s Muse Glimmer on NVIDIA 80

  • Tags: 模型发布 开源生态 大模型

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
Meta发布30B开源权重模型Muse Glimmer,支持120K+上下文,专为本地智能体工作流设计,配合NVIDIA生态,推动本地化AI应用。


v0.32.7 80

  • Tags: 开源生态 模型发布 推理优化 智能体

  • Source: GitHub Release - Ollama | 阅读原文

[摘要]
Ollama新增支持Meta最新开源30B多模态模型Muse Glimmer,首批通过MLX引擎支持Apple Silicon,专为本地智能体任务设计,可用于Claude Code等编码智能体。


Scale AI 开源 Muse 系列模型 80

  • Tags: 开源生态 模型发布 智能体

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Scale AI 开源 Muse 系列,包括 Muse Spark 1.2 权重及 30B 参数智能体模型 Muse Glimmer(Apache 2.0),可在 24GB 显存运行,降低智能体模型使用门槛。


Kimi K2.5: Visual Agentic Intelligence 80

  • Tags: 模型发布 多模态 智能体 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
月之暗面开源多模态智能体模型Kimi K2.5,联合优化文本与视觉,引入Agent Swarm并行框架,在编程、视觉、推理及智能体任务上达到SOTA,延迟降低4.5倍。


NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用 80

  • Tags: 模型发布 开源生态 语音技术 NVIDIA

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA 开源全双工语音模型 VoiceChat 11B,轮换延迟约450毫秒,支持对话中实时工具调用,需80GB显存,仅限研究用途。


StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection 78

  • Tags: AI安全 智能体 安全评测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出StepJack基准,针对计算机使用智能体的多步间接提示注入攻击,测试六个主流智能体后发现攻击成功率最高提升31.2点,凸显智能体安全风险。


Online Monitoring and Corrective Steering of Programming Agents 78

  • Tags: 智能体 AI编程 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新方法LivePlan可实时监控和纠正编程智能体的行为漂移与低效,在SWE-bench上提升修复率最高15.2%,成本仅增加0.08美元/实例,对长程任务有显著价值。


Skaling: Chinchilla's Exponents Meet Kaplan's Coupling 78

  • Tags: 大模型 训练方法 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出Skaling law,通过耦合模型规模与数据量改进神经缩放定律,在数据稀缺和过训练极端下预测误差降低1.5-3倍,并可用约10倍更少算力实现可靠外推,为下一代模型训练预算分配提供更高效框架。


智能体真的会用电脑吗?a16z 用数据给出答案 75

  • Tags: 智能体 评测 基准测试

  • Source: AI HOT 精选 | 阅读原文

[摘要]
a16z数据显示,计算机操作智能体在OSWorld-Verified基准上最佳成绩从一年前42%升至85%,超过人类约72%水平,其中Claude Fable 5领先。


Release: v5.15.0 75

  • Tags: 模型发布 开源生态 多模态 推理优化

  • Source: GitHub Release - Hugging Face Transformers | 阅读原文

[摘要]
Hugging Face Transformers v5.15.0 发布,新增 Meta 多模态模型 Muse Glimmer 等多模型支持,并优化注意力机制与内核,值得开发者和研究者关注。


Quantization Damage Is Multiplicative, Not Additive 75

  • Tags: 大模型 模型量化 AI安全 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究发现量化对模型决策的损伤是倍增而非加性,导致工具调用和安全拒绝失效,为量化部署提供量化风险预测方法。


宇树科技今日启动申购,A 股迎来"人形机器人第一股" 75

  • Tags: 公司动态 机器人 具身智能

  • Source: AI HOT 精选 | 阅读原文

[摘要]
宇树科技启动A股申购,成为“人形机器人第一股”,发行市值约610亿元,表明资本市场对人形机器人赛道的高度认可,行业格局或受影响。


Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry 75

  • Tags: 研究 推理优化 注意力机制 稀疏注意力

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出数据无关的稀疏注意力方法Autonomy-of-Heads,基于查询-键投影的谱几何识别检索头与流式头,无需校准数据,50%稀疏度下保持96.5%性能并大幅降低延迟与KV缓存开销。


ADIAS: Automated Design of Interactive Agentic Systems 75

  • Tags: 智能体 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
arXiv新研究提出ADIAS框架,采用问题中心优化方法自动化设计交互式智能体系统,在五个基准上平均超越最强基线25.2%,显著提升智能体性能。


GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization 75

  • Tags: 大模型 AI安全 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出GRASP方法,用GRPO强化学习训练本地模型实现对抗性匿名化,在隐私保护与语义保留上优于DPO蒸馏,成本约为GPT-4o的1%,可完全端侧运行。