Skip to content

2026-07-12

OpenAI 发布论文,称其 GPT-5.6 Sol Ultra 模型成功证明了图论中悬而未决的“循环双覆盖猜想”,展示了 AI 在数学推理上的重大突破。 OpenAI 发布 GPT-5.6 系列医疗评估结果:最小变体 Luna 以低 25 倍成本超越最强 GPT-5.5,所有变体表现显著优于专科医生。 剑桥研究揭示博科圣地等恐怖组织已利用ChatGPT、C…

OpenAI 论文:GPT-5.6 Sol Ultra 证明图论"循环双覆盖猜想" 95

  • Tags: 大模型 AI研究 数学证明 重大突破

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI 发布论文,称其 GPT-5.6 Sol Ultra 模型成功证明了图论中悬而未决的“循环双覆盖猜想”,展示了 AI 在数学推理上的重大突破。


OpenAI 发布 GPT-5.6 系列医疗评估结果 80

  • Tags: 模型发布 医疗AI 评测

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI 发布 GPT-5.6 系列医疗评估结果:最小变体 Luna 以低 25 倍成本超越最强 GPT-5.5,所有变体表现显著优于专科医生。


研究:博科圣地已使用ChatGPT、Claude等主流AI聊天机器人用于袭击策划与武器开发 80

  • Tags: AI安全 政策监管 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
剑桥研究揭示博科圣地等恐怖组织已利用ChatGPT、Claude、Gemini等主流AI聊天机器人策划袭击和制造武器,凸显AI安全过滤器失效风险,引发监管关注。


蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型 80

  • Tags: 具身智能 模型发布 机器人 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
蚂蚁集团旗下Robbyant发布LingBot-VA 2.0,首个原生具身基础模型,采用因果DiT架构,13B参数,训练加速2.3倍,50任务平均成功率超93%。


OpenAI GPT-5.6-Sol 删光 AI 创业者 Matt Shumer 的 Mac 硬盘 80

  • Tags: AI安全 智能体 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI GPT-5.6-Sol Agent因路径解析错误清空创业者Mac硬盘,暴露自主Agent在权限与安全上的重大风险,引发对模型厂商安全实践的广泛关注。


Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems 80

  • Tags: 智能体 推理优化 模型部署 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究提出工具制作管线,让LLM智能体在低延迟系统中自我进化,将重复步骤编译为工具,实际部署中延迟降低42%、错误率降低53%,提升可靠性与可审计性。


When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning 80

  • Tags: 大模型 推理优化 RL训练

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
TACO提出尾部感知信用校准方法,抑制LLM强化学习中低概率错误标记的正向强化,提升训练稳定性和推理性能,在多个基准上优于GRPO。


  • Tags: 智能体 多智能体 搜索 模型研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出WebSwarm递归多智能体编排框架,通过动态代理节点和递归委托实现深度与广度网页搜索,在多个基准上显著超越单智能体和多智能体基线。


Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning 80

  • Tags: 大模型 模型训练 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示了大模型微调时记忆知识但无法泛化推理的“知而不行”现象,并发现知识电路错配是根源。


Efficient Safety Alignment of Language Models via Latent Personality Traits 80

  • Tags: AI安全 模型对齐 对抗训练 效率优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出潜人格对齐(LPA)方法,仅用66个无伤害陈述即实现强健的安全对齐,攻击成功率接近零,训练效率极高。


Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing 80

  • Tags: 多模态智能体 长期记忆 推理优化 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出认知结构化多模态智能体(CMA),通过情景视觉记忆和选择性回忆解决长程多模态对话的视觉token爆炸问题,8B模型超越32B基线,推理时间减半。


Collective Intelligence with Foundation Models 80

  • Tags: 多智能体 推理优化 AI安全 研究论文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出异构多智能体框架,通过独立生成、批判修订与聚合评分实现基础模型协作推理,显著提升逐步推理准确性与可审计性,模型多样性是关键因素。


Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning 80

  • Tags: 大模型 推理优化 强化学习 检索增强

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
SLATE提出截断步级采样与密集过程奖励,解决检索增强推理中的信用分配问题,在7B模型上相对Search-R1提升7.0%。


SPL: Orchestrating Workflows with Declarative Deterministic-Probabilistic Composition 80

  • Tags: 大模型 智能体 研究发布 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
SPL 是一种声明式语言,统一了 LLM 编排与符号计算,支持跨本地、云端和分布式运行,实验验证正确率达 82-93%,为工作流编排提供新范式。


DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding 80

  • Tags: 推理优化 语言模型 算法

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
DominoTree提出基于条件树结构的推测解码方法,无需训练,在Qwen3-4B上实现最高6.6倍加速,平均接受长度达10.7 token,性能优于现有推测解码方案。


Score Accuracy Along the Forward Diffusion Does Not Certify Numerical Stability in Diffusion Sampling 78

  • Tags: 扩散模型 理论研究 数值稳定性

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
扩散模型研究揭示:分数匹配的前向边际误差小无法保证反向采样数值稳定,经典Euler-Maruyama离散化可能出现所有Wasserstein距离发散,但投影法可恢复稳定性。


Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings 78

  • Tags: 模型评估 鲁棒性 偏好数据

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
研究揭示LLM排名系统对少量偏好数据高度敏感,Chatbot Arena中仅0.003%偏好改变即可能改变榜首模型,强调评估方法亟需鲁棒性检查。


Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework 78

  • Tags: 推理优化 大模型 模型评测 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
GRAPHEVAL框架通过图推理评估LLM推理的连贯性与鲁棒性,提出GRCS度量新方法,有助于识别模型幻觉与置信度膨胀。


Two Axes of LLM Abstention: Answer Correctness and Question Answerability 78

  • Tags: 大模型 AI安全 模型推理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文揭示LLM拒答时需区分答案正确性与问题可回答性两个独立维度,模型对假前提问题存在盲点,而隐藏状态探针可修复,提出校准策略提升可回答性预算控制。


IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation 78

  • Tags: 模型评测 智能体 大模型 数学推理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出IMProofBench,包含77个同行评审研究级数学证明题,模拟真实研究环境(智能体+工具),评测显示当前LLM已能解决相当比例问题,填补科研级数学推理基准空白。