Skip to content

2026-08-12

英伟达联合Apollo、贝莱德等六大金融机构建立独立融资平台,计划动员超5000亿美元投资AI工厂建设,推动大规模算力基础设施落地。 OpenAI未发布的Astra模型攻克10道长期数学难题,涵盖球体堆积等方向,发布250页论文及Lean验证,展示AI数学推理的重大进展。 消息称Anthropic最快今年9月上市,估值达9650亿美元,年化收入超470亿美元…

英伟达联合六大机构融资5000亿美元建AI工厂 90

  • Tags: 芯片算力 公司动态 AI基础设施

  • Source: AI HOT 精选 | 阅读原文

[摘要]
英伟达联合Apollo、贝莱德等六大金融机构建立独立融资平台,计划动员超5000亿美元投资AI工厂建设,推动大规模算力基础设施落地。


OpenAI 用 Astra 模型攻克 10 道数学难题,数学家既兴奋又担忧 85

  • Tags: 大模型 AI研究 数学推理

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI未发布的Astra模型攻克10道长期数学难题,涵盖球体堆积等方向,发布250页论文及Lean验证,展示AI数学推理的重大进展。


消息称 Anthropic 最快今年 9 月上市,向投资者淡化 AI 模型竞争等挑战 85

  • Tags: 公司动态 IPO 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
消息称Anthropic最快今年9月上市,估值达9650亿美元,年化收入超470亿美元,并拓展医疗与生物学AI应用,或成史上最大规模IPO之一。


Human-Level Text-to-SQL via Reinforcement Learning on Verified Data, Without Pipeline Engineering 85

  • Tags: 大模型 模型微调 Text-to-SQL RLVR

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究提出用RLVR在清洗数据上微调大模型,无需复杂流水线即可达到人类级Text-to-SQL,新方法在基准上首次实现92.96%准确率,优于现有开源系统9%-22%,对数据库交互研究意义重大。


研究人员发现可读取ChatGPT等模型加密推理过程的API漏洞 82

  • Tags: AI安全 API漏洞 推理模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
研究团队发现OpenAI、Anthropic、Google等API存在漏洞,可读取ChatGPT等模型加密推理过程,并泄露密钥与用户数据,威胁推理模型隐私安全。


消息称英伟达开发万亿参数开源 AI 模型 Nemotron 4,目标挑战全球顶级 82

  • Tags: 模型发布 开源生态 芯片算力 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
英伟达正在研发开源AI模型Nemotron 4,最大版本预计超万亿参数,目标对标全球顶级开源模型,最早或于今年秋末发布,旨在扩大开源生态并带动GPU需求。


An Expectation-Maximization Perspective on Reinforcement Learning for LLM Reasoning 82

  • Tags: 强化学习 大模型 训练方法 推理优化

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出EM Policy Gradient(EMPG),将大模型推理强化学习重构为期望最大化问题,免除重要性加权和裁剪,理论保证单调改进,在GSM8K和MATH Hard上媲美或超越GRPO,推理更简洁且具结构化行为。


Process Supervision of Confidence Margin for Calibrated LLM Reasoning 82

  • Tags: 大模型 推理优化 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
介绍RLCM方法,一种校准感知的强化学习框架,通过置信度边际增强过程奖励,在数学、代码、逻辑和科学基准上提升LLM推理的置信度校准并保持准确性。


Towards Expert-level Medical AI for Real-time Video Consultations 82

  • Tags: 多模态 AI医疗 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
谷歌AMIE视频版在真实临床视频问诊中达到专家级水平,多项评估与医生相当或更优,推动多模态医疗AI迈向实际应用。


Matryoshka Language Model Suites 82

  • Tags: 训练方法 推理优化 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Matryoshka嵌套架构训练多尺寸子模型套件,节省36%训练算力,提升投机解码吞吐14-26%,为高效训练与推理提供新思路。


SuperCoder: Assembly Program Superoptimization with Large Language Models 82

  • Tags: 大模型 推理优化 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究首次验证LLM可作汇编程序超优化器,构建8072个汇编程序基准,微调Qwen2.5-Coder获得SuperCoder,正确率95%,比gcc -O3加速1.46倍,为超越编译器启发式的程序优化奠基。


ChatGPT 与 Gemini 双双突破 10 亿用户 80

  • Tags: 大模型 产品发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI与Google的聊天机器人月活均超10亿,标志AI消费级产品进入新阶段,行业格局进一步巩固。


NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents 80

  • Tags: 模型发布 智能体 NVIDIA

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
NVIDIA发布Nemotron 3.5 Lightning,专为长时间运行的AI智能体优化,提升工具调用、结果验证等高频任务的执行速度与准确性,值得关注。


NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务 80

  • Tags: 模型发布 开源生态 智能体 芯片算力

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA发布开源30B MoE模型Nemotron 3.5 Lightning,面向常驻智能体,生成速度最高提升4倍、任务完成时间缩短30%,支持本地微调并可运行于RTX PC、DGX Spark等设备。


BDH-CQ: In-Context Learning with Recurrent Latent Reasoning 80

  • Tags: 研究进展 推理优化 成本效率

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
新研究BDH-CQ将上下文学习与循环潜在推理结合,以150M参数在ARC-AGI-1上达29.5% pass@2,推理成本仅0.0007美元/任务,打破成本-精度帕累托前沿,展示高性价比推理新路径。


ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention 80

  • Tags: 推理优化 大模型 模型研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出ROM流式干预框架,通过轻量隐藏状态检测器减少大推理模型过度思考,在多个基准上平均缩短响应45%并提升准确率,属重要推理优化研究。


Length-MAX Tokenizer for Language Models 80

  • Tags: 大模型 推理优化 研究方法

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出Length-MAX分词器,通过图划分优化平均token长度,相比BPE减少13-18% token,提升训练和推理效率,并改善下游任务表现。


v0.32.9 78

  • Tags: 模型发布 开源生态 智能体 公司动态

  • Source: GitHub Release - Ollama | 阅读原文

[摘要]
NVIDIA发布Nemotron 3.5 Lightning,一款开放30B MoE模型,仅3B活跃参数,面向始终在线的智能体执行层,并配套NemoClaw安全与开源管理栈,Ollama可直接运行。


TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories 78

  • Tags: AI安全 智能体 基准测试 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
推出TraceSafe-Bench基准,系统评估LLM护栏在多步工具调用轨迹中的安全有效性,发现护栏效果主要取决于结构化数据解析能力而非语义对齐,通用LLM优于专用护栏。


Scaling Inherently Interpretable Language Models 78

  • Tags: 可解释性 模型发布 AI安全 扩散语言模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出将可解释性作为训练约束而非事后分析,推出Steerling-8B扩散语言模型,支持概念归因与干预,且性能对标计算量高2-16倍的开源模型,表明可解释性可随规模提升。