2026-07-11
OpenAI发布GPT-5.6系列模型,包括旗舰Sol、平衡型Terra和成本最优Luna,在多项基准测试中超越Claude Fable 5,创SOTA,成本更低,并引入Programmatic Tool Calling等功能。 美团开源万亿参数大模型 LongCat-2.0(1.6T参数,48B激活),专为Agentic Coding设计,支持百万上下文,…
GPT-5.6 系列模型发布:Sol、Terra、Luna 95
Tags:
模型发布大模型OpenAISource:
AI HOT 精选| 阅读原文
[摘要]
OpenAI发布GPT-5.6系列模型,包括旗舰Sol、平衡型Terra和成本最优Luna,在多项基准测试中超越Claude Fable 5,创SOTA,成本更低,并引入Programmatic Tool Calling等功能。
美团 LongCat-2.0 正式开源,同步开放国产卡推理代码 95
Tags:
模型发布开源生态推理优化大模型Source:
AI HOT 精选| 阅读原文
[摘要]
美团开源万亿参数大模型 LongCat-2.0(1.6T参数,48B激活),专为Agentic Coding设计,支持百万上下文,在五万卡国产算力集群上完成推理,同步开源多精度版本及优化推理代码。
DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持 85
Tags:
模型发布开源生态训练优化芯片算力Source:
AI HOT 精选| 阅读原文
[摘要]
DeepSeek-V4 Flash 强化学习训练成功迁移至 AMD MI355X GPU,使用 Miles 框架及 ROCm 软件栈,验证了大规模 MoE 模型在 AMD 硬件上的端到端训练可行性,拓展了算力生态。
腾讯 Hy3 发布:295B MoE 模型性能超 GLM-5.1,价格仅 $0.14/M 85
Tags:
模型发布大模型开源生态性价比Source:
AI HOT 精选| 阅读原文
[摘要]
腾讯发布295B参数MoE架构Hy3模型,仅21B活跃参数,性能超越GLM-5.1,Apache2.0开源,输入价格仅$0.14/百万token,性价比显著。
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment 85
Tags:
智能体研究开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出DeepSearch-Evolve自我蒸馏框架,基于可验证环境DeepSearch-World训练网络智能体,无需更强模型蒸馏即可在多个基准上取得有竞争力的性能,并将开源代码与数据。
Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型 85
Tags:
模型发布大模型AI健康多模态Source:
AI HOT 精选| 阅读原文
[摘要]
Google Research 推出 SensorFM,基于超100万亿分钟多模态传感器数据预训练的健康基础模型,可迁移至35项健康预测任务,加速个人健康智能体发展。
Uncertainty-gated selection for block-sparse attention 85
Tags:
推理优化长上下文注意力机制模型架构Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出不确定性门控路由机制,动态调整块稀疏注意力保留块数,在LongBench-v2上准确率提升28个百分点,兼容多种大模型,有效降低长上下文计算开销。
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks 82
Tags:
智能体模型评测基准测试多模态Source:
arXiv Computation and Language| 阅读原文
[摘要]
介绍 UniClawBench,首个基于能力驱动的主动智能体真实世界任务基准,包含 400 个双语任务及闭环评估策略,为智能体能力评测提供新框架。
Apple 起诉 OpenAI 窃取商业机密 80
Tags:
公司动态AI安全政策监管Source:
AI HOT 精选| 阅读原文
[摘要]
Apple 起诉 OpenAI 窃取商业机密,指控其通过招聘渗透窃取产品细节与硬件技术,可能重塑 AI 行业竞争与人才流动规则。
小红书发布大模型新架构 PIPO 80
Tags:
模型发布推理优化大模型Source:
AI HOT 精选| 阅读原文
[摘要]
小红书发布新架构PIPO,通过输入压缩和输出扩展实现推理加速约1.86倍,基于Qwen3.5在AIME 2025提升+7.15 pass@4。
Towards Free Normalization: Fusing Normalization into GEMM and Attention Kernels 80
Tags:
推理优化开源生态技术博客Source:
PyTorch Blog| 阅读原文
[摘要]
Meta开源将LayerNorm/RMSNorm融合到GEMM和Attention核的优化技术,显著加速推理,代码已公开。
扎克伯格首度回应 Meta"算力过剩":没人会嫌算力太多,但租出去更赚钱 80
Tags:
公司动态算力芯片算力云服务Source:
AI HOT 精选| 阅读原文
[摘要]
扎克伯格首度回应Meta算力过剩传闻,称内部算力满负荷但出租更赚钱;Meta计划推出云计算业务并自研AI芯片,2027年算力目标14吉瓦。
Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback 80
Tags:
大模型训练方法RLHFSource:
arXiv Computation and Language| 阅读原文
[摘要]
提出基于Wasserstein的分布鲁棒遗憾优化(DRRO)方法缓解RLHF中的奖励过度优化问题,理论推导了闭式解并给出实用策略梯度算法。
AI 能否回答 3 万亿美元的问题? 80
Tags:
行业分析公司动态投资回报Source:
AI HOT 精选| 阅读原文
[摘要]
Sequoia合伙人David Cahn更新估算:2026年全球AI基础设施投入达1.5万亿美元,需产生3万亿美元收入才回本。Anthropic ARR 600亿美元,OpenAI收入130亿,缺口仍大,开放权重模型和token降价带来风险。
Cognition 推出 SWE-1.7,接近 GPT 5.5 与 Opus 智能水平 80
Tags:
模型发布智能体编程基准评测Source:
AI HOT 精选| 阅读原文
[摘要]
Cognition 发布 SWE-1.7 编程智能体模型,基于 Kimi K2.7 强化学习训练,在多项代码基准上接近 GPT-5.5 和 Opus 水平,已部署至 Devin 并通过 Cerebras 提供高速推理。
Holographic Neural PCFG for Unsupervised Parsing 80
Tags:
研究NLP无监督句法分析Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出 Hol-PCFG 模型,在全息嵌入框架下实现无监督成分句法分析,六种语言达到SOTA,参数量减少99.94%,大幅提升效率与可解释性。
Elon Musk称赞Anthropic并承诺不切断其算力 80
Tags:
公司动态算力行业格局Source:
AI HOT 精选| 阅读原文
[摘要]
Elon Musk公开称赞Anthropic是AI领导者,承诺不会切断其计算资源;双方签署价值约400亿美元的超大规模算力合同,影响AI行业资源竞争格局。
Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models 80
Tags:
训练方法大模型推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
Hidden Decoding提出在固定Transformer主干下通过序列长度维度扩展计算量的方法,无需增加参数量即可在100B+ MoE规模提升性能,为大模型提供新的scaling路径。
微软发布Flint:面向AI智能体的可视化语言 80
Tags:
产品发布开源生态智能体可视化Source:
AI HOT 精选| 阅读原文
[摘要]
微软研究院推出开源可视化中间语言Flint,专为AI智能体设计,支持46种图表类型,可自动生成美观图表并集成到智能体工作流,降低数据可视化门槛。
What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness 80
Tags:
大模型推理优化AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究通过探针分析LLM内部表征,显著提升了预测校准性与推理忠实性,并能提前预测答案,节省30-47%推理成本,为模型审计提供新工具。