Skip to content

2026-07-10

OpenAI发布由GPT-5.6驱动的ChatGPT Work,实现跨应用自主完成复杂任务,面向Pro等用户推出,标志智能体重要突破。 OpenAI发布其最强模型,官方声称是有史以来最佳模型及最佳博文,标志AI能力重大提升。 微软宣布GPT-5.6成为Microsoft 365 Copilot首选模型,大幅提升Word、Excel、PowerPoint等办公…

OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体 95

  • Tags: 智能体 模型发布 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI发布由GPT-5.6驱动的ChatGPT Work,实现跨应用自主完成复杂任务,面向Pro等用户推出,标志智能体重要突破。


OpenAI 发布最强模型与最佳博文 85

  • Tags: 模型发布 大模型 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI发布其最强模型,官方声称是有史以来最佳模型及最佳博文,标志AI能力重大提升。


GPT-5.6 is now the preferred model in Microsoft 365 Copilot 85

  • Tags: 模型发布 产品更新 公司动态 大模型

  • Source: OpenAI News | 阅读原文

[摘要]
微软宣布GPT-5.6成为Microsoft 365 Copilot首选模型,大幅提升Word、Excel、PowerPoint等办公应用的AI能力,标志着GPT-5系列的重要部署。


法国对英伟达反垄断调查接近尾声,聚焦 CUDA 生态和产业投资 85

  • Tags: 政策监管 芯片算力 公司动态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
法国反垄断调查英伟达接近尾声,聚焦CUDA生态依赖与AI云投资,若认定滥用支配地位,最高可处全球年营业额10%罚款,将影响全球AI算力格局。


OpenAI发布政府与国家安全合作伙伴关系方针 85

  • Tags: 公司动态 政策监管 AI安全

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI公布国家安全原则,明确AI在政府与国防领域的部署规范,强调保护公民、防御关键基础设施,禁止大规模监控和自主武器,并与多国开展网络安全合作。


利润超10亿美元、ARR剑指千亿,Anthropic抢先OpenAI冲击IPO 85

  • Tags: 公司动态 大模型 AI安全 金融

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic第三季度利润预计超10亿美元,已秘密提交IPO申请,与OpenAI合计年收入近千亿美元,Claude Code推动B2B市场领先,若上市将成为最大AI实验室IPO。


Towards Understanding Steering Strength 85

  • Tags: 模型控制 LLM AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
首次理论分析LLM中引导强度的影响,揭示对概率和性能的非单调效应,为后训练控制提供理论基础。


Trees from Marginals: Autoregressive drafting with factorized priors 85

  • Tags: 推理优化 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
推出Weaver方法,结合因子化先验构建提议树,实现自回归语言模型4.37倍推理加速,显著优于现有方法。


Co-LMLM: Continuous-Query Limited Memory Language Models 85

  • Tags: 模型发布 大模型 检索增强生成

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出连续查询有限记忆语言模型Co-LMLM,将事实知识外部化到知识库,按需检索。在困惑度与事实精度上超越此前LMLM和普通LLM,360M模型性能可比gpt-4o-mini。


Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems 85

  • Tags: 训练方法 推理优化 强化学习

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出AdaPrefix-GRPO,通过自适应前缀控制使困难问题成功率稳定在50%附近,最大化GRPO梯度信号,0.6B模型准确率提升2.1倍,Qwen3-1.7B提升1.6倍,显著优化推理训练效率。


RL Post-Training Builds Compositional Reasoning Strategies 85

  • Tags: 强化学习 推理优化 模型训练

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究显示RL后训练能将原始符号操作组合成新推理策略,与拒绝微调对比,关键差异在选择性而非探索量,揭示了组合机制。


Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning 85

  • Tags: 大模型 推理优化 强化学习

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Agon跨模型强化学习方法,让两个模型相互评分推理,无需过程标签,在DeepMath上pass@1提升一倍,显著改善复杂推理能力。


蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video 82

  • Tags: 模型发布 开源生态 具身智能 MoE

  • Source: AI HOT 精选 | 阅读原文

[摘要]
蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video,30B参数仅激活3B,效率提升3倍,在多项基准领先,可用于机器人动作预测和仿真数据生成。


Geometric Self-Distillation for Reasoning Generalization 82

  • Tags: 模型训练 推理优化 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出GeoSD几何自蒸馏方法,通过Hellinger损失和近端项抑制蒸馏漂移,在数学推理基准上提升分布外准确率5.7-8.6点,适用1.7B-32B模型。


Aurora 1.5: Extending open foundation models for weather and Earth-system applications 80

  • Tags: 模型发布 基础模型 气象应用 公司动态

  • Source: Microsoft Research - AI | 阅读原文

[摘要]
微软发布Aurora 1.5,扩展开放地球系统基础模型,新增22个变量和小时级分辨率,提升天气、气候与能源场景的实用性。


Google 推出 LiteRT.js:高性能 Web AI 推理运行时 80

  • Tags: 推理优化 产品发布 Web AI Google

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google 发布 LiteRT.js,基于 WebGPU/WebNN 的高性能浏览器端 AI 推理运行时,支持回退到 WebAssembly,提升 Web AI 部署能力。


消息称特斯拉三代擎天柱人形机器人初步定型,马斯克放话达不成产能目标就开掉整个采购团队 80

  • Tags: 人形机器人 公司动态 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
特斯拉Optimus Gen 3人形机器人定型量产,马斯克要求周产能年底达2000-2500台,否则开除采购团队,标志人形机器人产业进入新阶段。


Ollama 开发者数达890万,B轮融资由Theory领投 80

  • Tags: 公司动态 开源生态 融资

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Ollama 宣布拥有890万开发者并完成B轮融资,由Theory领投,表明其在本地模型运行工具中的重要地位和资本认可。


Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型 80

  • Tags: 模型发布 开源生态 机器人

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Robbyant 开源 6B 参数跨实体机器人 VLA 模型 LingBot-VLA 2.0,统一多机器人动作表示,性能超越 π0.5,Apache-2.0 许可。


OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷 80

  • Tags: 评测基准 模型评估 AI安全 OpenAI

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI审计编码评测基准SWE-Bench Pro,发现约30%任务存在缺陷,提醒模型开发者审视评测结果,引发对AI评测可靠性的反思。