Skip to content

2026-07-03

提出原型语言模型架构PRISM,通过稀疏原型混合实现可解释预测与高效训练数据归因,性能接近或超越密集基线,归因速度提升500倍。 微软投入25亿美元成立Frontier Company,派驻6000名AI工程师到企业现场,强化企业AI部署与工程服务,定位为OpenAI/Anthropic的平台中立替代方案。 Anthropic与五角大楼就Claude军事用途…

Prototype Language Models 85

  • Tags: 模型架构 可解释性 训练数据归因

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出原型语言模型架构PRISM,通过稀疏原型混合实现可解释预测与高效训练数据归因,性能接近或超越密集基线,归因速度提升500倍。


Microsoft 成立"Frontier Company",斥资 25 亿美元派驻 6000 名 AI 工程师到企业客户现场 82

  • Tags: 公司动态 大模型 AI工程化

  • Source: AI HOT 精选 | 阅读原文

[摘要]
微软投入25亿美元成立Frontier Company,派驻6000名AI工程师到企业现场,强化企业AI部署与工程服务,定位为OpenAI/Anthropic的平台中立替代方案。


Anthropic与五角大楼控权之争:Claude军事用途护栏分歧 82

  • Tags: AI安全 公司动态 政策监管 军事应用

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic与五角大楼就Claude军事用途护栏产生严重分歧,导致五角大楼将其列为供应链风险,部分国防项目已切换至其他AI工具。


VideoFlexTok:可变长度粗到细视频分词 80

  • Tags: 模型发布 推理优化 视频生成

  • Source: AI HOT 精选 | 阅读原文

[摘要]
苹果提出VideoFlexTok可变长度视频分词,粗到细结构仅需1/8 token,1.1B参数达到5.2B模型质量,大幅提升视频生成效率。


阿里巴巴发布 Page Agent:开源 JavaScript 库实现网页 DOM 自然语言操控 80

  • Tags: 开源生态 智能体 模型应用

  • Source: AI HOT 精选 | 阅读原文

[摘要]
阿里巴巴开源 Page Agent,一个纯文本模型即可通过自然语言操控网页DOM的JavaScript库,无需截图或后端,支持任意兼容模型,适用于AI副驾等场景。


快手可灵AI获初始投资者20.28亿美元注资,投后估值180亿美元 80

  • Tags: 公司动态 AI视频生成 融资 算力

  • Source: AI HOT 精选 | 阅读原文

[摘要]
快手可灵AI获20.28亿美元注资,估值180亿美元,计划12个月内赴港上市,募资用于扩充算力及数据中心。


RL微调VLM的鲁棒性与思维链一致性研究 80

  • Tags: 视觉语言模型 AI安全 思维链 鲁棒性

  • Source: AI HOT 精选 | 阅读原文

[摘要]
苹果研究揭示RL微调VLM时文本扰动降低鲁棒性和思维链忠实性,开源模型更易受损,需联合关注正确性、鲁棒性与推理忠实性。


Fable 5 在 RLI 基准中达成 16.1% 自动化率,较八个月前提升六倍 80

  • Tags: 智能体 基准测试 自动化 AI能力评估

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Fable 5 智能体在 240 个自由职业项目基准中自动化率达 16.1%,是八个月前最佳系统的六倍,超越 GPT-5.5 和 Opus,展示 AI 智能体能力显著提升,但多数项目仍需人类。


Senior SWE-Bench:评估AI智能体作为高级工程师的基准测试 80

  • Tags: 智能体 基准测试 模型评估 开源生态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Senior SWE-Bench发布,评估AI智能体完成高级软件工程师任务的新基准,包括功能开发与Bug修复;最强模型Claude Opus通过率仅24%,显示前沿AI在超75%任务中未达高级工程师水平。


谷歌AI建设导致2025年用电量增长37% 80

  • Tags: 公司动态 芯片算力 产业变化

  • Source: AI HOT 精选 | 阅读原文

[摘要]
谷歌2025年用电量同比增37%,数据中心消耗超4200万MWh,超过部分国家总用电量,AI基建是主因,凸显AI规模扩张对能源系统的巨大压力。


OpenAI提议美国政府持股5%估值426亿美元 80

  • Tags: 公司动态 政策监管

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI提议向美国政府提供5%股份,估值约426亿美元,CEO称与公众分享AI发展红利,引发行业对政企关系与监管格局的关注。


Kimi K2.7 Code 已在 GitHub Copilot 上正式发布 80

  • Tags: 模型发布 开源生态 产品集成 AI编程

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Kimi K2.7 Code开源模型正式集成至GitHub Copilot,成为平台首个可选开源权重模型,为开发者提供更低成本的AI编程选择。


昆仑万维天工3.2发布Skywork Tags,AI智能体加入工作群聊 80

  • Tags: 智能体 产品发布 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
昆仑万维发布天工3.2的Skywork Tags,将AI智能体接入Slack、飞书等即时通讯工具,团队可在群聊中@使用,共享版Agent持续学习表现更优,无需切换窗口或迁移数据。


BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding 80

  • Tags: 推理优化 模型加速 扩散模型 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
BlockPilot提出实例自适应策略学习,通过动态预测最优块大小来加速扩散模型投机解码,在Qwen3-4B上实现4.20倍加速,显著提升推理效率。


When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors 80

  • Tags: 大模型 推理优化 评测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究系统评估大模型在表格任务中的数据引用错误,提出批评模型检测并减少错误,提升答案准确率最高12%。


Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues 80

  • Tags: AI安全 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示LLM在道德安全评估中存在“表演性合规”:明确身份标签时表现公平,但需推断身份时公平性显著下降,提出Cue Visibility Gap指标提升评估鲁棒性。


CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield 80

  • Tags: 研究 模型压缩 高效训练 MoE

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究提出选择性监督(SGT)、深度压缩(层数压缩)与混合专家(MoEE)三种互补技术,实现2.5倍参数压缩并保持性能,为高效语言模型训练提供新路径。


AutoTrainess: Teaching Language Models to Improve Language Models Autonomously 80

  • Tags: 大模型 训练优化 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
AutoTrainess提出通过语言模型代理自动化训练流程(规划、数据准备、训练、评估),实现语言模型自主改进,在PostTrainBench上显著超越基线。


The Bidirectional Process Reward Model 80

  • Tags: 过程奖励模型 推理优化 LLM 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出双向过程奖励模型BiPRM,通过并行右向左评估流和门控融合,仅增0.3%参数、5%延迟,在多项推理基准上显著提升质量,平均相对增益达10.6%-37.7%。


Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity? 80

  • Tags: 多模态 模型评估 不确定性估计

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 Visual Semantic Entropy (VSE),通过仅扰动图像来估计视觉语言模型在视觉歧义下的不确定性,在多模型和基准上达到 SOTA,提升模型可靠性。