2026-08-25
NVIDIA Vera Rubin NVL72实测显示,智能体工作负载下每兆瓦吞吐量较GB300 NVL72最高提升30倍,每百万token成本降低35倍,树立AI智能体效率新标准。 OpenAI 发布 GPT-5.6 模型家族并登陆编程智能体 Kiro,含 Sol、Terra、Luna 三款,Terra 在 Terminal-Bench 2.1 中任务成本…
NVIDIA Vera Rubin NVL72 树立 AI 智能体效率新标准:每瓦特工作量提升至 30 倍 85
Tags:
芯片算力推理优化智能体公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
NVIDIA Vera Rubin NVL72实测显示,智能体工作负载下每兆瓦吞吐量较GB300 NVL72最高提升30倍,每百万token成本降低35倍,树立AI智能体效率新标准。
GPT-5.6 登陆 Kiro,为开发者提升性价比 82
Tags:
模型发布智能体AI编程公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI 发布 GPT-5.6 模型家族并登陆编程智能体 Kiro,含 Sol、Terra、Luna 三款,Terra 在 Terminal-Bench 2.1 中任务成本降低约 82%,与 AWS 合作优化,提升开发者编程性价比。
MetaRoCE:为 AI 规模以太网打造的全新 RDMA 传输协议 82
Tags:
开源生态推理优化芯片算力公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
Meta 开源 MetaRoCE,专为 AI 工作负载设计的 RDMA 传输协议,支持乱序交付和多路径,无需 PFC,可在百万 GPU 规模下提升以太网性能,兼容现有 API。
NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt 82
Tags:
芯片算力推理优化智能体公司动态Source:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
NVIDIA发布Vera Rubin与Blackwell平台,宣称在智能体AI每瓦性能上树立新标准,提升多步推理与工具调用效率,对推理优化与算力生态有重要影响。
AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification 78
Tags:
推理优化芯片算力研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究AsmEvo提出智能体汇编级优化AMD GPU内核,无需源码,通过功能等价验证实现最高3.88倍加速,对生产负载有显著提升,推动推理优化。
Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs 78
Tags:
推理优化模型压缩开源生态研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出量化感知修复(QAH)方法,用于恢复压缩并4比特量化的大模型性能,在GPT-OSS 120B压缩至60B的MXFP4流程中,QAH学生模型在7/9基准上匹配或超越bfloat16源模型,内存减少约4倍,训练速度比QAT快7倍,并开源Hypernova-60B权重。
AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale 76
Tags:
智能体训练方法模型发布研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
AgentMercury 提出从业务场景规模化合成可执行环境的新框架,构建4783个跨行业环境用于强化学习训练,显著提升Qwen3.5模型在推理、编码等基准上的表现,环境构建本身也可学习,为智能体训练提供新范式。
Solving Agentic AI Fleet Challenges with NVIDIA Vera CPU 75
Tags:
芯片算力推理优化智能体公司动态Source:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
NVIDIA发布Vera CPU,旨在解决智能体AI集群的算力与能效挑战,提升AI工厂整体任务完成效率,对推理基础设施和算力生态有重要影响。
How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context on NVIDIA Vera Rubin 75
Tags:
推理优化芯片算力公司动态Source:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
NVIDIA发布Groq 3 LPX推理加速器,面向Vera Rubin平台,实现长上下文超快交互,提升AI推理性能,值得关注。
When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha 75
Tags:
AI安全模型评测智能体政策监管Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究评估AI心理聊天机器人在青少年(Gen Alpha)中的安全风险,发现模型存在10-14个百分点的词汇理解与临床风险校准差距,可能漏报大量危机,建议强制人工介入和监管。
Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks 75
Tags:
AI安全智能体AI编程基准评测Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准SUSVIBES评估12种AI编程智能体在真实任务中的代码安全性,发现功能正确率57%但安全率仅11.8%,警示vibe coding在生产环境中的风险。
Mint-Agent: Introducing Finance-Native Agentic Foundation Models 75
Tags:
智能体模型发布金融AISource:
arXiv Computation and Language| 阅读原文
[摘要]
Mint-Agent发布金融原生智能体基础模型Mint-Cu(9B)和Mint-Ag(27B),在专业金融基准上超越GPT-5.6等模型,结合推理与长程执行能力,推动可信金融智能发展。
TreeWY: Speculative Verification for Gated DeltaNet Hybrids 75
Tags:
推理优化模型发布混合架构Source:
arXiv Computation and Language| 阅读原文
[摘要]
TreeWY提出树形WY变换,消除Gated DeltaNet混合模型投机解码中的状态快照,显著降低内存占用,提升吞吐和TTFT,对混合架构推理优化有重要价值。
b10615 72
Tags:
推理优化开源生态模型推理Source:
GitHub Release - llama.cpp| 阅读原文
[摘要]
llama.cpp 为 Apple Metal 后端新增基于设备的 Flash Attention 向量化调优,覆盖多种芯片并优化量化 KV 缓存,提升推理性能。
OpenAI 正为一切构建 AI 智能体,但用户会愿意交出控制权吗? 72
Tags:
智能体产品发布公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI 推出 ChatGPT Work,将 Codex 改造为面向非工程师的智能体产品,最低月费 20 美元,旨在扩大智能体采用并支撑训练投入。
Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions 72
Tags:
语音生成模型发布多模态Source:
arXiv Computation and Language| 阅读原文
[摘要]
新TTS模型Poly-InstructTTS通过多模态管道构建千小时指令标注语料,支持千种细粒度情感风格的自然语言控制语音合成,提升表达力与指令遵循能力。
Minimax Optimality of Score-Entropy Discrete Diffusion 72
Tags:
扩散模型理论研究机器学习Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
该论文研究离散扩散模型中分数熵估计的统计极限,提出匹配极小极大下界的MLE阈值估计器,证明SEDD可实现近最优样本复杂度,对离散扩散理论有重要贡献。
How to Train a Real-World Silicon Concierge? Internalizing Complex Business Workflow to Only OneModel 72
Tags:
智能体模型发布推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
新范式OneModel将复杂业务流程内化为模型参数,替代模块化工业智能体,在金融系统中延迟降低超50%、解决率提升至83.3%,展示统一模型架构的潜力。
Decoupled Vision-Language System for Multimodal Understanding and Generation 72
Tags:
多模态模型架构研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出多模态大模型新架构Libra,解耦视觉与语言系统,通过跨模态桥接和动态路由实现理解与生成相互促进,在多项基准上表现优异。
DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data 72
Tags:
模型发布开源生态大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
丹麦基础模型团队发布1B参数开源语言模型Mimir v1,仅用合规后训练数据,在英语及丹麦语上达到前沿性能,挑战更大模型,推动开源与数据伦理。