Skip to content

2026-07-11

OpenAI发布GPT-5.6系列模型,包括旗舰Sol、平衡型Terra和成本最优Luna,在多项基准测试中超越Claude Fable 5,创SOTA,成本更低,并引入Programmatic Tool Calling等功能。 美团开源万亿参数大模型 LongCat-2.0(1.6T参数,48B激活),专为Agentic Coding设计,支持百万上下文,…

GPT-5.6 系列模型发布:Sol、Terra、Luna 95

  • Tags: 模型发布 大模型 OpenAI

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI发布GPT-5.6系列模型,包括旗舰Sol、平衡型Terra和成本最优Luna,在多项基准测试中超越Claude Fable 5,创SOTA,成本更低,并引入Programmatic Tool Calling等功能。


美团 LongCat-2.0 正式开源,同步开放国产卡推理代码 95

  • Tags: 模型发布 开源生态 推理优化 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
美团开源万亿参数大模型 LongCat-2.0(1.6T参数,48B激活),专为Agentic Coding设计,支持百万上下文,在五万卡国产算力集群上完成推理,同步开源多精度版本及优化推理代码。


DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持 85

  • Tags: 模型发布 开源生态 训练优化 芯片算力

  • Source: AI HOT 精选 | 阅读原文

[摘要]
DeepSeek-V4 Flash 强化学习训练成功迁移至 AMD MI355X GPU,使用 Miles 框架及 ROCm 软件栈,验证了大规模 MoE 模型在 AMD 硬件上的端到端训练可行性,拓展了算力生态。


腾讯 Hy3 发布:295B MoE 模型性能超 GLM-5.1,价格仅 $0.14/M 85

  • Tags: 模型发布 大模型 开源生态 性价比

  • Source: AI HOT 精选 | 阅读原文

[摘要]
腾讯发布295B参数MoE架构Hy3模型,仅21B活跃参数,性能超越GLM-5.1,Apache2.0开源,输入价格仅$0.14/百万token,性价比显著。


DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment 85

  • Tags: 智能体 研究 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出DeepSearch-Evolve自我蒸馏框架,基于可验证环境DeepSearch-World训练网络智能体,无需更强模型蒸馏即可在多个基准上取得有竞争力的性能,并将开源代码与数据。


Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型 85

  • Tags: 模型发布 大模型 AI健康 多模态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google Research 推出 SensorFM,基于超100万亿分钟多模态传感器数据预训练的健康基础模型,可迁移至35项健康预测任务,加速个人健康智能体发展。


Uncertainty-gated selection for block-sparse attention 85

  • Tags: 推理优化 长上下文 注意力机制 模型架构

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出不确定性门控路由机制,动态调整块稀疏注意力保留块数,在LongBench-v2上准确率提升28个百分点,兼容多种大模型,有效降低长上下文计算开销。


UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks 82

  • Tags: 智能体 模型评测 基准测试 多模态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
介绍 UniClawBench,首个基于能力驱动的主动智能体真实世界任务基准,包含 400 个双语任务及闭环评估策略,为智能体能力评测提供新框架。


Apple 起诉 OpenAI 窃取商业机密 80

  • Tags: 公司动态 AI安全 政策监管

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Apple 起诉 OpenAI 窃取商业机密,指控其通过招聘渗透窃取产品细节与硬件技术,可能重塑 AI 行业竞争与人才流动规则。


小红书发布大模型新架构 PIPO 80

  • Tags: 模型发布 推理优化 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
小红书发布新架构PIPO,通过输入压缩和输出扩展实现推理加速约1.86倍,基于Qwen3.5在AIME 2025提升+7.15 pass@4。


Towards Free Normalization: Fusing Normalization into GEMM and Attention Kernels 80

  • Tags: 推理优化 开源生态 技术博客

  • Source: PyTorch Blog | 阅读原文

[摘要]
Meta开源将LayerNorm/RMSNorm融合到GEMM和Attention核的优化技术,显著加速推理,代码已公开。


扎克伯格首度回应 Meta"算力过剩":没人会嫌算力太多,但租出去更赚钱 80

  • Tags: 公司动态 算力 芯片算力 云服务

  • Source: AI HOT 精选 | 阅读原文

[摘要]
扎克伯格首度回应Meta算力过剩传闻,称内部算力满负荷但出租更赚钱;Meta计划推出云计算业务并自研AI芯片,2027年算力目标14吉瓦。


Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback 80

  • Tags: 大模型 训练方法 RLHF

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出基于Wasserstein的分布鲁棒遗憾优化(DRRO)方法缓解RLHF中的奖励过度优化问题,理论推导了闭式解并给出实用策略梯度算法。


AI 能否回答 3 万亿美元的问题? 80

  • Tags: 行业分析 公司动态 投资回报

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Sequoia合伙人David Cahn更新估算:2026年全球AI基础设施投入达1.5万亿美元,需产生3万亿美元收入才回本。Anthropic ARR 600亿美元,OpenAI收入130亿,缺口仍大,开放权重模型和token降价带来风险。


Cognition 推出 SWE-1.7,接近 GPT 5.5 与 Opus 智能水平 80

  • Tags: 模型发布 智能体 编程 基准评测

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Cognition 发布 SWE-1.7 编程智能体模型,基于 Kimi K2.7 强化学习训练,在多项代码基准上接近 GPT-5.5 和 Opus 水平,已部署至 Devin 并通过 Cerebras 提供高速推理。


Holographic Neural PCFG for Unsupervised Parsing 80

  • Tags: 研究 NLP 无监督句法分析

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 Hol-PCFG 模型,在全息嵌入框架下实现无监督成分句法分析,六种语言达到SOTA,参数量减少99.94%,大幅提升效率与可解释性。


Elon Musk称赞Anthropic并承诺不切断其算力 80

  • Tags: 公司动态 算力 行业格局

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Elon Musk公开称赞Anthropic是AI领导者,承诺不会切断其计算资源;双方签署价值约400亿美元的超大规模算力合同,影响AI行业资源竞争格局。


Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models 80

  • Tags: 训练方法 大模型 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Hidden Decoding提出在固定Transformer主干下通过序列长度维度扩展计算量的方法,无需增加参数量即可在100B+ MoE规模提升性能,为大模型提供新的scaling路径。


微软发布Flint:面向AI智能体的可视化语言 80

  • Tags: 产品发布 开源生态 智能体 可视化

  • Source: AI HOT 精选 | 阅读原文

[摘要]
微软研究院推出开源可视化中间语言Flint,专为AI智能体设计,支持46种图表类型,可自动生成美观图表并集成到智能体工作流,降低数据可视化门槛。


What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness 80

  • Tags: 大模型 推理优化 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究通过探针分析LLM内部表征,显著提升了预测校准性与推理忠实性,并能提前预测答案,节省30-47%推理成本,为模型审计提供新工具。