Skip to content

2026-08-25

NVIDIA Vera Rubin NVL72实测显示,智能体工作负载下每兆瓦吞吐量较GB300 NVL72最高提升30倍,每百万token成本降低35倍,树立AI智能体效率新标准。 OpenAI 发布 GPT-5.6 模型家族并登陆编程智能体 Kiro,含 Sol、Terra、Luna 三款,Terra 在 Terminal-Bench 2.1 中任务成本…

NVIDIA Vera Rubin NVL72 树立 AI 智能体效率新标准:每瓦特工作量提升至 30 倍 85

  • Tags: 芯片算力 推理优化 智能体 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA Vera Rubin NVL72实测显示,智能体工作负载下每兆瓦吞吐量较GB300 NVL72最高提升30倍,每百万token成本降低35倍,树立AI智能体效率新标准。


GPT-5.6 登陆 Kiro,为开发者提升性价比 82

  • Tags: 模型发布 智能体 AI编程 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI 发布 GPT-5.6 模型家族并登陆编程智能体 Kiro,含 Sol、Terra、Luna 三款,Terra 在 Terminal-Bench 2.1 中任务成本降低约 82%,与 AWS 合作优化,提升开发者编程性价比。


MetaRoCE:为 AI 规模以太网打造的全新 RDMA 传输协议 82

  • Tags: 开源生态 推理优化 芯片算力 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Meta 开源 MetaRoCE,专为 AI 工作负载设计的 RDMA 传输协议,支持乱序交付和多路径,无需 PFC,可在百万 GPU 规模下提升以太网性能,兼容现有 API。


NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt 82

  • Tags: 芯片算力 推理优化 智能体 公司动态

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
NVIDIA发布Vera Rubin与Blackwell平台,宣称在智能体AI每瓦性能上树立新标准,提升多步推理与工具调用效率,对推理优化与算力生态有重要影响。


AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification 78

  • Tags: 推理优化 芯片算力 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究AsmEvo提出智能体汇编级优化AMD GPU内核,无需源码,通过功能等价验证实现最高3.88倍加速,对生产负载有显著提升,推动推理优化。


Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs 78

  • Tags: 推理优化 模型压缩 开源生态 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出量化感知修复(QAH)方法,用于恢复压缩并4比特量化的大模型性能,在GPT-OSS 120B压缩至60B的MXFP4流程中,QAH学生模型在7/9基准上匹配或超越bfloat16源模型,内存减少约4倍,训练速度比QAT快7倍,并开源Hypernova-60B权重。


AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale 76

  • Tags: 智能体 训练方法 模型发布 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
AgentMercury 提出从业务场景规模化合成可执行环境的新框架,构建4783个跨行业环境用于强化学习训练,显著提升Qwen3.5模型在推理、编码等基准上的表现,环境构建本身也可学习,为智能体训练提供新范式。


Solving Agentic AI Fleet Challenges with NVIDIA Vera CPU 75

  • Tags: 芯片算力 推理优化 智能体 公司动态

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
NVIDIA发布Vera CPU,旨在解决智能体AI集群的算力与能效挑战,提升AI工厂整体任务完成效率,对推理基础设施和算力生态有重要影响。


How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context on NVIDIA Vera Rubin 75

  • Tags: 推理优化 芯片算力 公司动态

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
NVIDIA发布Groq 3 LPX推理加速器,面向Vera Rubin平台,实现长上下文超快交互,提升AI推理性能,值得关注。


When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha 75

  • Tags: AI安全 模型评测 智能体 政策监管

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究评估AI心理聊天机器人在青少年(Gen Alpha)中的安全风险,发现模型存在10-14个百分点的词汇理解与临床风险校准差距,可能漏报大量危机,建议强制人工介入和监管。


Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks 75

  • Tags: AI安全 智能体 AI编程 基准评测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准SUSVIBES评估12种AI编程智能体在真实任务中的代码安全性,发现功能正确率57%但安全率仅11.8%,警示vibe coding在生产环境中的风险。


Mint-Agent: Introducing Finance-Native Agentic Foundation Models 75

  • Tags: 智能体 模型发布 金融AI

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Mint-Agent发布金融原生智能体基础模型Mint-Cu(9B)和Mint-Ag(27B),在专业金融基准上超越GPT-5.6等模型,结合推理与长程执行能力,推动可信金融智能发展。


TreeWY: Speculative Verification for Gated DeltaNet Hybrids 75

  • Tags: 推理优化 模型发布 混合架构

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
TreeWY提出树形WY变换,消除Gated DeltaNet混合模型投机解码中的状态快照,显著降低内存占用,提升吞吐和TTFT,对混合架构推理优化有重要价值。


b10615 72

  • Tags: 推理优化 开源生态 模型推理

  • Source: GitHub Release - llama.cpp | 阅读原文

[摘要]
llama.cpp 为 Apple Metal 后端新增基于设备的 Flash Attention 向量化调优,覆盖多种芯片并优化量化 KV 缓存,提升推理性能。


OpenAI 正为一切构建 AI 智能体,但用户会愿意交出控制权吗? 72

  • Tags: 智能体 产品发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI 推出 ChatGPT Work,将 Codex 改造为面向非工程师的智能体产品,最低月费 20 美元,旨在扩大智能体采用并支撑训练投入。


Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions 72

  • Tags: 语音生成 模型发布 多模态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新TTS模型Poly-InstructTTS通过多模态管道构建千小时指令标注语料,支持千种细粒度情感风格的自然语言控制语音合成,提升表达力与指令遵循能力。


Minimax Optimality of Score-Entropy Discrete Diffusion 72

  • Tags: 扩散模型 理论研究 机器学习

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
该论文研究离散扩散模型中分数熵估计的统计极限,提出匹配极小极大下界的MLE阈值估计器,证明SEDD可实现近最优样本复杂度,对离散扩散理论有重要贡献。


How to Train a Real-World Silicon Concierge? Internalizing Complex Business Workflow to Only OneModel 72

  • Tags: 智能体 模型发布 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新范式OneModel将复杂业务流程内化为模型参数,替代模块化工业智能体,在金融系统中延迟降低超50%、解决率提升至83.3%,展示统一模型架构的潜力。


Decoupled Vision-Language System for Multimodal Understanding and Generation 72

  • Tags: 多模态 模型架构 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出多模态大模型新架构Libra,解耦视觉与语言系统,通过跨模态桥接和动态路由实现理解与生成相互促进,在多项基准上表现优异。


DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data 72

  • Tags: 模型发布 开源生态 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
丹麦基础模型团队发布1B参数开源语言模型Mimir v1,仅用合规后训练数据,在英语及丹麦语上达到前沿性能,挑战更大模型,推动开源与数据伦理。