2026-08-11
Meta发布开源30B参数模型Muse Glimmer,专为本地常驻智能体工作流优化,可在消费级硬件运行,Apache 2.0许可,推动端侧智能体应用。 提出反事实模拟训练(CST),通过奖励能预测反事实输入的思维链,提升CoT推理的忠实度,实验显示监测准确率大幅提升,对模型可解释性和安全监控有重要价值。 OpenAI 发布网络安全专用模型 GPT-5.6-…
Meta 发布开源模型 Muse Glimmer 85
Tags:
模型发布开源生态智能体公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
Meta发布开源30B参数模型Muse Glimmer,专为本地常驻智能体工作流优化,可在消费级硬件运行,Apache 2.0许可,推动端侧智能体应用。
Counterfactual Simulation Training for Chain-of-Thought Faithfulness 82
Tags:
大模型推理优化AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出反事实模拟训练(CST),通过奖励能预测反事实输入的思维链,提升CoT推理的忠实度,实验显示监测准确率大幅提升,对模型可解释性和安全监控有重要价值。
OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型 80
Tags:
模型发布AI安全公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,面向授权漏洞研究与安全测试,应对防御窗口收窄挑战,为安全人员提供专门工具。
Expanding Daybreak as the Cyber Defense Window Narrows 80
Tags:
模型发布AI安全产品发布Source:
OpenAI News| 阅读原文
[摘要]
OpenAI推出网络安全专用模型GPT-5.6-Cyber,通过Daybreak Red平台供授权漏洞研究与安全测试使用,扩展AI在攻防领域的应用。
Fast, On Device Agentic AI with Muse Glimmer on ExecuTorch 80
Tags:
模型发布开源生态智能体边缘计算Source:
PyTorch Blog| 阅读原文
[摘要]
Meta发布开源模型Muse Glimmer,30B参数,专为端侧智能体工作流设计,并由ExecuTorch提供NVIDIA端到端支持,值得关注。
Run Local Agentic AI Workflows with Meta’s Muse Glimmer on NVIDIA 80
Tags:
模型发布开源生态大模型Source:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
Meta发布30B开源权重模型Muse Glimmer,支持120K+上下文,专为本地智能体工作流设计,配合NVIDIA生态,推动本地化AI应用。
v0.32.7 80
Tags:
开源生态模型发布推理优化智能体Source:
GitHub Release - Ollama| 阅读原文
[摘要]
Ollama新增支持Meta最新开源30B多模态模型Muse Glimmer,首批通过MLX引擎支持Apple Silicon,专为本地智能体任务设计,可用于Claude Code等编码智能体。
Scale AI 开源 Muse 系列模型 80
Tags:
开源生态模型发布智能体Source:
AI HOT 精选| 阅读原文
[摘要]
Scale AI 开源 Muse 系列,包括 Muse Spark 1.2 权重及 30B 参数智能体模型 Muse Glimmer(Apache 2.0),可在 24GB 显存运行,降低智能体模型使用门槛。
Kimi K2.5: Visual Agentic Intelligence 80
Tags:
模型发布多模态智能体开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
月之暗面开源多模态智能体模型Kimi K2.5,联合优化文本与视觉,引入Agent Swarm并行框架,在编程、视觉、推理及智能体任务上达到SOTA,延迟降低4.5倍。
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用 80
Tags:
模型发布开源生态语音技术NVIDIASource:
AI HOT 精选| 阅读原文
[摘要]
NVIDIA 开源全双工语音模型 VoiceChat 11B,轮换延迟约450毫秒,支持对话中实时工具调用,需80GB显存,仅限研究用途。
StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection 78
Tags:
AI安全智能体安全评测Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出StepJack基准,针对计算机使用智能体的多步间接提示注入攻击,测试六个主流智能体后发现攻击成功率最高提升31.2点,凸显智能体安全风险。
Online Monitoring and Corrective Steering of Programming Agents 78
Tags:
智能体AI编程研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新方法LivePlan可实时监控和纠正编程智能体的行为漂移与低效,在SWE-bench上提升修复率最高15.2%,成本仅增加0.08美元/实例,对长程任务有显著价值。
Skaling: Chinchilla's Exponents Meet Kaplan's Coupling 78
Tags:
大模型训练方法研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出Skaling law,通过耦合模型规模与数据量改进神经缩放定律,在数据稀缺和过训练极端下预测误差降低1.5-3倍,并可用约10倍更少算力实现可靠外推,为下一代模型训练预算分配提供更高效框架。
智能体真的会用电脑吗?a16z 用数据给出答案 75
Tags:
智能体评测基准测试Source:
AI HOT 精选| 阅读原文
[摘要]
a16z数据显示,计算机操作智能体在OSWorld-Verified基准上最佳成绩从一年前42%升至85%,超过人类约72%水平,其中Claude Fable 5领先。
Release: v5.15.0 75
Tags:
模型发布开源生态多模态推理优化Source:
GitHub Release - Hugging Face Transformers| 阅读原文
[摘要]
Hugging Face Transformers v5.15.0 发布,新增 Meta 多模态模型 Muse Glimmer 等多模型支持,并优化注意力机制与内核,值得开发者和研究者关注。
Quantization Damage Is Multiplicative, Not Additive 75
Tags:
大模型模型量化AI安全研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究发现量化对模型决策的损伤是倍增而非加性,导致工具调用和安全拒绝失效,为量化部署提供量化风险预测方法。
宇树科技今日启动申购,A 股迎来"人形机器人第一股" 75
Tags:
公司动态机器人具身智能Source:
AI HOT 精选| 阅读原文
[摘要]
宇树科技启动A股申购,成为“人形机器人第一股”,发行市值约610亿元,表明资本市场对人形机器人赛道的高度认可,行业格局或受影响。
Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry 75
Tags:
研究推理优化注意力机制稀疏注意力Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出数据无关的稀疏注意力方法Autonomy-of-Heads,基于查询-键投影的谱几何识别检索头与流式头,无需校准数据,50%稀疏度下保持96.5%性能并大幅降低延迟与KV缓存开销。
ADIAS: Automated Design of Interactive Agentic Systems 75
Tags:
智能体研究发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
arXiv新研究提出ADIAS框架,采用问题中心优化方法自动化设计交互式智能体系统,在五个基准上平均超越最强基线25.2%,显著提升智能体性能。
GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization 75
Tags:
大模型AI安全研究发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出GRASP方法,用GRPO强化学习训练本地模型实现对抗性匿名化,在隐私保护与语义保留上优于DPO蒸馏,成本约为GPT-4o的1%,可完全端侧运行。