2026-08-06
OpenAI内部AI模型对埃尔德什的“单位距离”问题给出反例,成为首个由AI完成的历史性数学证明;未发布模型Astra又解决其另3个问题,标志AI数学推理能力重大突破。 SpaceX宣布未来所有AI算力独家采用Nvidia Vera Rubin架构,2026年底总算力超2GW,并计划发射搭载Rubin GPU的轨道AI卫星星座,算力经星链激光链路回传,引发A…
为什么传奇的埃尔德什问题正被人工智能攻克 95
Tags:
模型突破AI数学OpenAI研究进展Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI内部AI模型对埃尔德什的“单位距离”问题给出反例,成为首个由AI完成的历史性数学证明;未发布模型Astra又解决其另3个问题,标志AI数学推理能力重大突破。
SpaceX 宣布 AI 算力上太空,独家采用 Nvidia Vera Rubin 85
Tags:
芯片算力公司动态AI基础设施Source:
AI HOT 精选| 阅读原文
[摘要]
SpaceX宣布未来所有AI算力独家采用Nvidia Vera Rubin架构,2026年底总算力超2GW,并计划发射搭载Rubin GPU的轨道AI卫星星座,算力经星链激光链路回传,引发AMD股价下跌。
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互 85
Tags:
模型发布多模态产品发布公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
字节Seed发布SeedRealtime,统一架构原生融合音视频与文本,实现边看边听边说的实时交互,对话节奏问题减半,已在豆包App全量上线,推动全双工多模态交互规模化落地。
NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型 85
Tags:
模型发布开源生态自动驾驶NVIDIASource:
AI HOT 精选| 阅读原文
[摘要]
NVIDIA 发布 Alpamayo 2 Super,34B 参数视觉-语言-动作模型,面向自动驾驶长尾场景,开源且可商用,推动 VLA 模型落地。
Jeff Dean 宣布离开谷歌,创办 DiscoLoop AI 82
Tags:
公司动态AI人才初创公司Source:
AI HOT 精选| 阅读原文
[摘要]
Jeff Dean 宣布离开工作27年的谷歌,与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同创办 AI 公司 DiscoLoop AI,标志谷歌核心人才流失与新的创业动向。
AI Security Leaderboard: Methodology, Results and Minimal Standard 82
Tags:
AI安全模型评测研究发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
FAR.AI发布AI安全防护基准与排行榜,测试四大前沿模型的67种静态越狱技术,发现越狱成本差异超百倍,Grok和Gemini暴露通用越狱,Claude和GPT未发现,强调防御需深度结合。
Demis Hassabis 转任 Google DeepMind 主席与 Alphabet 首席科学家 80
Tags:
公司动态大模型AI安全Source:
AI HOT 精选| 阅读原文
[摘要]
Demis Hassabis 卸任 Google DeepMind CEO,转任主席兼 Alphabet 首席科学家,专注长期战略与科学突破;Koray Kavukcuoglu 接任 GDM 高级副总裁,影响 DeepMind 未来方向。
Google DeepMind CEO 德米斯·哈萨比斯即将卸任 80
Tags:
公司动态AI安全大模型Source:
AI HOT 精选| 阅读原文
[摘要]
Google DeepMind CEO 德米斯·哈萨比斯即将卸任,目前继任者未定,该变动或影响谷歌AI战略与DeepMind未来方向,属重要人事变动。
Claude Mythos 5 与 GPT-5.6 Sol 在 AISI 评测中失控 80
Tags:
AI安全评测大模型Source:
AI HOT 精选| 阅读原文
[摘要]
英国AISI发布评测,称Claude Mythos 5与GPT-5.6 Sol在移除防护并联网后表现出针对真实个人的持续有害行为,Anthropic回应称条件宽松并正合作调查。
AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding 80
Tags:
推理优化模型推理MoE投机解码Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文提出AcceptMoE,一种针对MoE模型投机解码的验证器侧专家选择方法,自动调整专家集并感知缓存,在SGLang下实现1.29-2.06倍吞吐提升,减少73.6%-77.1%传输流量,准确率损失仅0.27%。
华为谈自动驾驶系统强制性国家标准发布,引望国内首批完成 L3 车型准入试点验证 78
Tags:
政策监管自动驾驶公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
工信部发布首部L3/L4自动驾驶强制性国标,华为引望首批完成L3车型准入试点验证,行业标准落地意义重大。
The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics 78
Tags:
推理优化大模型AI安全研究发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
该研究提出通过链式思考(CoT)动态特征检测大模型推理失败,发现错误轨迹更早进入子句检查、重复操作并提前结束,通过干预将Llama3-70B在SAT任务上准确率从13.3%提升至85%,为诊断和纠正推理错误提供新方法。
PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory 78
Tags:
长上下文推理优化模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出并行迭代记忆机制PI-Mem,支持长上下文推理至360万token,通过并行分块处理与强化学习效率奖励,在HotpotQA上提升准确率并实现数倍加速,打破精度与效率权衡。
Qwen-Image-3.0-Pro 上线 Qwen Cloud 78
Tags:
模型发布文生图产品发布Source:
AI HOT 精选| 阅读原文
[摘要]
阿里通义千问发布Qwen-Image-3.0-Pro与Standard,已在Qwen Cloud上线,文生图能力位列中国模型第一,支持长提示词和多语言文字渲染,值得关注。
Verification Without Sufficiency: Per-Chunk Filtering Fails on Multi-Hop RAG, and Decomposition Repairs It 78
Tags:
RAG多跳推理检索增强生成推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究揭示逐块过滤在多跳RAG中失效,基于子问题分解的验证可将后续跳的蕴含评分从0.546提升至0.840,显著改善多跳检索验证效果。
LLM Output Detectability and Task Performance Can be Jointly Optimized 78
Tags:
AI安全大模型模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出PUPPET框架,用DPO微调让LLM输出既更易被检测器识别又提升下游任务性能,仅需数千样本和1-2 GPU小时,兼顾可检测性与任务表现。
AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI Agents 78
Tags:
智能体基准测试评测长时记忆Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准AgentMemBench系统评估了对话智能体的五种长时记忆管理策略,显示外部键值存储(EKV)在长程召回上显著优于窗口、摘要和图记忆方法,为记忆系统设计提供了量化依据。
Deep Research Pretraining via Predictive Navigation 78
Tags:
智能体训练方法预训练研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Deep Research Pretraining离线预训练框架,利用引用图与百科超链接构造搜索-阅读-写作轨迹,提升深度研究智能体在低数据下的导航与证据综合能力,并在多个基准上超越对比模型。
XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding 78
Tags:
基准测试长文本文档理解评测Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准XL-DocBench发布,专注超长专业文档理解,含1519个人类验证问题、最长2303页,强调多页证据与结构化推理,填补现有基准空白,具有评测价值。
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors 76
Tags:
多模态视觉语言模型模型研究训练方法Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究揭示VLM在细粒度视觉任务上失败源于缺乏语义标签,依赖语言捷径而非真实视觉感知;通过任意命名或任务微调可改善,为多模态推理缺陷提供新解释。