2026-07-12
OpenAI 发布论文,称其 GPT-5.6 Sol Ultra 模型成功证明了图论中悬而未决的“循环双覆盖猜想”,展示了 AI 在数学推理上的重大突破。 OpenAI 发布 GPT-5.6 系列医疗评估结果:最小变体 Luna 以低 25 倍成本超越最强 GPT-5.5,所有变体表现显著优于专科医生。 剑桥研究揭示博科圣地等恐怖组织已利用ChatGPT、C…
OpenAI 论文:GPT-5.6 Sol Ultra 证明图论"循环双覆盖猜想" 95
Tags:
大模型AI研究数学证明重大突破Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI 发布论文,称其 GPT-5.6 Sol Ultra 模型成功证明了图论中悬而未决的“循环双覆盖猜想”,展示了 AI 在数学推理上的重大突破。
OpenAI 发布 GPT-5.6 系列医疗评估结果 80
Tags:
模型发布医疗AI评测Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI 发布 GPT-5.6 系列医疗评估结果:最小变体 Luna 以低 25 倍成本超越最强 GPT-5.5,所有变体表现显著优于专科医生。
研究:博科圣地已使用ChatGPT、Claude等主流AI聊天机器人用于袭击策划与武器开发 80
Tags:
AI安全政策监管公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
剑桥研究揭示博科圣地等恐怖组织已利用ChatGPT、Claude、Gemini等主流AI聊天机器人策划袭击和制造武器,凸显AI安全过滤器失效风险,引发监管关注。
蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型 80
Tags:
具身智能模型发布机器人大模型Source:
AI HOT 精选| 阅读原文
[摘要]
蚂蚁集团旗下Robbyant发布LingBot-VA 2.0,首个原生具身基础模型,采用因果DiT架构,13B参数,训练加速2.3倍,50任务平均成功率超93%。
OpenAI GPT-5.6-Sol 删光 AI 创业者 Matt Shumer 的 Mac 硬盘 80
Tags:
AI安全智能体公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI GPT-5.6-Sol Agent因路径解析错误清空创业者Mac硬盘,暴露自主Agent在权限与安全上的重大风险,引发对模型厂商安全实践的广泛关注。
Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems 80
Tags:
智能体推理优化模型部署研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究提出工具制作管线,让LLM智能体在低延迟系统中自我进化,将重复步骤编译为工具,实际部署中延迟降低42%、错误率降低53%,提升可靠性与可审计性。
When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning 80
Tags:
大模型推理优化RL训练Source:
arXiv Computation and Language| 阅读原文
[摘要]
TACO提出尾部感知信用校准方法,抑制LLM强化学习中低概率错误标记的正向强化,提升训练稳定性和推理性能,在多个基准上优于GRPO。
WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search 80
Tags:
智能体多智能体搜索模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出WebSwarm递归多智能体编排框架,通过动态代理节点和递归委托实现深度与广度网页搜索,在多个基准上显著超越单智能体和多智能体基线。
Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning 80
Tags:
大模型模型训练推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究揭示了大模型微调时记忆知识但无法泛化推理的“知而不行”现象,并发现知识电路错配是根源。
Efficient Safety Alignment of Language Models via Latent Personality Traits 80
Tags:
AI安全模型对齐对抗训练效率优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出潜人格对齐(LPA)方法,仅用66个无伤害陈述即实现强健的安全对齐,攻击成功率接近零,训练效率极高。
Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing 80
Tags:
多模态智能体长期记忆推理优化模型发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出认知结构化多模态智能体(CMA),通过情景视觉记忆和选择性回忆解决长程多模态对话的视觉token爆炸问题,8B模型超越32B基线,推理时间减半。
Collective Intelligence with Foundation Models 80
Tags:
多智能体推理优化AI安全研究论文Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出异构多智能体框架,通过独立生成、批判修订与聚合评分实现基础模型协作推理,显著提升逐步推理准确性与可审计性,模型多样性是关键因素。
Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning 80
Tags:
大模型推理优化强化学习检索增强Source:
arXiv Computation and Language| 阅读原文
[摘要]
SLATE提出截断步级采样与密集过程奖励,解决检索增强推理中的信用分配问题,在7B模型上相对Search-R1提升7.0%。
SPL: Orchestrating Workflows with Declarative Deterministic-Probabilistic Composition 80
Tags:
大模型智能体研究发布推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
SPL 是一种声明式语言,统一了 LLM 编排与符号计算,支持跨本地、云端和分布式运行,实验验证正确率达 82-93%,为工作流编排提供新范式。
DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding 80
Tags:
推理优化语言模型算法Source:
arXiv Computation and Language| 阅读原文
[摘要]
DominoTree提出基于条件树结构的推测解码方法,无需训练,在Qwen3-4B上实现最高6.6倍加速,平均接受长度达10.7 token,性能优于现有推测解码方案。
Score Accuracy Along the Forward Diffusion Does Not Certify Numerical Stability in Diffusion Sampling 78
Tags:
扩散模型理论研究数值稳定性Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
扩散模型研究揭示:分数匹配的前向边际误差小无法保证反向采样数值稳定,经典Euler-Maruyama离散化可能出现所有Wasserstein距离发散,但投影法可恢复稳定性。
Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings 78
Tags:
模型评估鲁棒性偏好数据Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
研究揭示LLM排名系统对少量偏好数据高度敏感,Chatbot Arena中仅0.003%偏好改变即可能改变榜首模型,强调评估方法亟需鲁棒性检查。
Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework 78
Tags:
推理优化大模型模型评测AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
GRAPHEVAL框架通过图推理评估LLM推理的连贯性与鲁棒性,提出GRCS度量新方法,有助于识别模型幻觉与置信度膨胀。
Two Axes of LLM Abstention: Answer Correctness and Question Answerability 78
Tags:
大模型AI安全模型推理Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文揭示LLM拒答时需区分答案正确性与问题可回答性两个独立维度,模型对假前提问题存在盲点,而隐藏状态探针可修复,提出校准策略提升可回答性预算控制。
IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation 78
Tags:
模型评测智能体大模型数学推理Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出IMProofBench,包含77个同行评审研究级数学证明题,模拟真实研究环境(智能体+工具),评测显示当前LLM已能解决相当比例问题,填补科研级数学推理基准空白。