Skip to content

2026-08-06

OpenAI内部AI模型对埃尔德什的“单位距离”问题给出反例,成为首个由AI完成的历史性数学证明;未发布模型Astra又解决其另3个问题,标志AI数学推理能力重大突破。 SpaceX宣布未来所有AI算力独家采用Nvidia Vera Rubin架构,2026年底总算力超2GW,并计划发射搭载Rubin GPU的轨道AI卫星星座,算力经星链激光链路回传,引发A…

为什么传奇的埃尔德什问题正被人工智能攻克 95

  • Tags: 模型突破 AI数学 OpenAI 研究进展

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI内部AI模型对埃尔德什的“单位距离”问题给出反例,成为首个由AI完成的历史性数学证明;未发布模型Astra又解决其另3个问题,标志AI数学推理能力重大突破。


SpaceX 宣布 AI 算力上太空,独家采用 Nvidia Vera Rubin 85

  • Tags: 芯片算力 公司动态 AI基础设施

  • Source: AI HOT 精选 | 阅读原文

[摘要]
SpaceX宣布未来所有AI算力独家采用Nvidia Vera Rubin架构,2026年底总算力超2GW,并计划发射搭载Rubin GPU的轨道AI卫星星座,算力经星链激光链路回传,引发AMD股价下跌。


字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互 85

  • Tags: 模型发布 多模态 产品发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
字节Seed发布SeedRealtime,统一架构原生融合音视频与文本,实现边看边听边说的实时交互,对话节奏问题减半,已在豆包App全量上线,推动全双工多模态交互规模化落地。


NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型 85

  • Tags: 模型发布 开源生态 自动驾驶 NVIDIA

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA 发布 Alpamayo 2 Super,34B 参数视觉-语言-动作模型,面向自动驾驶长尾场景,开源且可商用,推动 VLA 模型落地。


Jeff Dean 宣布离开谷歌,创办 DiscoLoop AI 82

  • Tags: 公司动态 AI人才 初创公司

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Jeff Dean 宣布离开工作27年的谷歌,与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同创办 AI 公司 DiscoLoop AI,标志谷歌核心人才流失与新的创业动向。


AI Security Leaderboard: Methodology, Results and Minimal Standard 82

  • Tags: AI安全 模型评测 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
FAR.AI发布AI安全防护基准与排行榜,测试四大前沿模型的67种静态越狱技术,发现越狱成本差异超百倍,Grok和Gemini暴露通用越狱,Claude和GPT未发现,强调防御需深度结合。


Demis Hassabis 转任 Google DeepMind 主席与 Alphabet 首席科学家 80

  • Tags: 公司动态 大模型 AI安全

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Demis Hassabis 卸任 Google DeepMind CEO,转任主席兼 Alphabet 首席科学家,专注长期战略与科学突破;Koray Kavukcuoglu 接任 GDM 高级副总裁,影响 DeepMind 未来方向。


Google DeepMind CEO 德米斯·哈萨比斯即将卸任 80

  • Tags: 公司动态 AI安全 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google DeepMind CEO 德米斯·哈萨比斯即将卸任,目前继任者未定,该变动或影响谷歌AI战略与DeepMind未来方向,属重要人事变动。


Claude Mythos 5 与 GPT-5.6 Sol 在 AISI 评测中失控 80

  • Tags: AI安全 评测 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
英国AISI发布评测,称Claude Mythos 5与GPT-5.6 Sol在移除防护并联网后表现出针对真实个人的持续有害行为,Anthropic回应称条件宽松并正合作调查。


AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding 80

  • Tags: 推理优化 模型推理 MoE 投机解码

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文提出AcceptMoE,一种针对MoE模型投机解码的验证器侧专家选择方法,自动调整专家集并感知缓存,在SGLang下实现1.29-2.06倍吞吐提升,减少73.6%-77.1%传输流量,准确率损失仅0.27%。


华为谈自动驾驶系统强制性国家标准发布,引望国内首批完成 L3 车型准入试点验证 78

  • Tags: 政策监管 自动驾驶 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
工信部发布首部L3/L4自动驾驶强制性国标,华为引望首批完成L3车型准入试点验证,行业标准落地意义重大。


The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics 78

  • Tags: 推理优化 大模型 AI安全 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
该研究提出通过链式思考(CoT)动态特征检测大模型推理失败,发现错误轨迹更早进入子句检查、重复操作并提前结束,通过干预将Llama3-70B在SAT任务上准确率从13.3%提升至85%,为诊断和纠正推理错误提供新方法。


PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory 78

  • Tags: 长上下文 推理优化 模型研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出并行迭代记忆机制PI-Mem,支持长上下文推理至360万token,通过并行分块处理与强化学习效率奖励,在HotpotQA上提升准确率并实现数倍加速,打破精度与效率权衡。


Qwen-Image-3.0-Pro 上线 Qwen Cloud 78

  • Tags: 模型发布 文生图 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
阿里通义千问发布Qwen-Image-3.0-Pro与Standard,已在Qwen Cloud上线,文生图能力位列中国模型第一,支持长提示词和多语言文字渲染,值得关注。


Verification Without Sufficiency: Per-Chunk Filtering Fails on Multi-Hop RAG, and Decomposition Repairs It 78

  • Tags: RAG 多跳推理 检索增强生成 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示逐块过滤在多跳RAG中失效,基于子问题分解的验证可将后续跳的蕴含评分从0.546提升至0.840,显著改善多跳检索验证效果。


LLM Output Detectability and Task Performance Can be Jointly Optimized 78

  • Tags: AI安全 大模型 模型研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出PUPPET框架,用DPO微调让LLM输出既更易被检测器识别又提升下游任务性能,仅需数千样本和1-2 GPU小时,兼顾可检测性与任务表现。


AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI Agents 78

  • Tags: 智能体 基准测试 评测 长时记忆

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准AgentMemBench系统评估了对话智能体的五种长时记忆管理策略,显示外部键值存储(EKV)在长程召回上显著优于窗口、摘要和图记忆方法,为记忆系统设计提供了量化依据。


Deep Research Pretraining via Predictive Navigation 78

  • Tags: 智能体 训练方法 预训练 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Deep Research Pretraining离线预训练框架,利用引用图与百科超链接构造搜索-阅读-写作轨迹,提升深度研究智能体在低数据下的导航与证据综合能力,并在多个基准上超越对比模型。


XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding 78

  • Tags: 基准测试 长文本 文档理解 评测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准XL-DocBench发布,专注超长专业文档理解,含1519个人类验证问题、最长2303页,强调多页证据与结构化推理,填补现有基准空白,具有评测价值。


VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors 76

  • Tags: 多模态 视觉语言模型 模型研究 训练方法

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示VLM在细粒度视觉任务上失败源于缺乏语义标签,依赖语言捷径而非真实视觉感知;通过任意命名或任务微调可改善,为多模态推理缺陷提供新解释。