2026-07-03
提出原型语言模型架构PRISM,通过稀疏原型混合实现可解释预测与高效训练数据归因,性能接近或超越密集基线,归因速度提升500倍。 微软投入25亿美元成立Frontier Company,派驻6000名AI工程师到企业现场,强化企业AI部署与工程服务,定位为OpenAI/Anthropic的平台中立替代方案。 Anthropic与五角大楼就Claude军事用途…
Prototype Language Models 85
Tags:
模型架构可解释性训练数据归因Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
提出原型语言模型架构PRISM,通过稀疏原型混合实现可解释预测与高效训练数据归因,性能接近或超越密集基线,归因速度提升500倍。
Microsoft 成立"Frontier Company",斥资 25 亿美元派驻 6000 名 AI 工程师到企业客户现场 82
Tags:
公司动态大模型AI工程化Source:
AI HOT 精选| 阅读原文
[摘要]
微软投入25亿美元成立Frontier Company,派驻6000名AI工程师到企业现场,强化企业AI部署与工程服务,定位为OpenAI/Anthropic的平台中立替代方案。
Anthropic与五角大楼控权之争:Claude军事用途护栏分歧 82
Tags:
AI安全公司动态政策监管军事应用Source:
AI HOT 精选| 阅读原文
[摘要]
Anthropic与五角大楼就Claude军事用途护栏产生严重分歧,导致五角大楼将其列为供应链风险,部分国防项目已切换至其他AI工具。
VideoFlexTok:可变长度粗到细视频分词 80
Tags:
模型发布推理优化视频生成Source:
AI HOT 精选| 阅读原文
[摘要]
苹果提出VideoFlexTok可变长度视频分词,粗到细结构仅需1/8 token,1.1B参数达到5.2B模型质量,大幅提升视频生成效率。
阿里巴巴发布 Page Agent:开源 JavaScript 库实现网页 DOM 自然语言操控 80
Tags:
开源生态智能体模型应用Source:
AI HOT 精选| 阅读原文
[摘要]
阿里巴巴开源 Page Agent,一个纯文本模型即可通过自然语言操控网页DOM的JavaScript库,无需截图或后端,支持任意兼容模型,适用于AI副驾等场景。
快手可灵AI获初始投资者20.28亿美元注资,投后估值180亿美元 80
Tags:
公司动态AI视频生成融资算力Source:
AI HOT 精选| 阅读原文
[摘要]
快手可灵AI获20.28亿美元注资,估值180亿美元,计划12个月内赴港上市,募资用于扩充算力及数据中心。
RL微调VLM的鲁棒性与思维链一致性研究 80
Tags:
视觉语言模型AI安全思维链鲁棒性Source:
AI HOT 精选| 阅读原文
[摘要]
苹果研究揭示RL微调VLM时文本扰动降低鲁棒性和思维链忠实性,开源模型更易受损,需联合关注正确性、鲁棒性与推理忠实性。
Fable 5 在 RLI 基准中达成 16.1% 自动化率,较八个月前提升六倍 80
Tags:
智能体基准测试自动化AI能力评估Source:
AI HOT 精选| 阅读原文
[摘要]
Fable 5 智能体在 240 个自由职业项目基准中自动化率达 16.1%,是八个月前最佳系统的六倍,超越 GPT-5.5 和 Opus,展示 AI 智能体能力显著提升,但多数项目仍需人类。
Senior SWE-Bench:评估AI智能体作为高级工程师的基准测试 80
Tags:
智能体基准测试模型评估开源生态Source:
AI HOT 精选| 阅读原文
[摘要]
Senior SWE-Bench发布,评估AI智能体完成高级软件工程师任务的新基准,包括功能开发与Bug修复;最强模型Claude Opus通过率仅24%,显示前沿AI在超75%任务中未达高级工程师水平。
谷歌AI建设导致2025年用电量增长37% 80
Tags:
公司动态芯片算力产业变化Source:
AI HOT 精选| 阅读原文
[摘要]
谷歌2025年用电量同比增37%,数据中心消耗超4200万MWh,超过部分国家总用电量,AI基建是主因,凸显AI规模扩张对能源系统的巨大压力。
OpenAI提议美国政府持股5%估值426亿美元 80
Tags:
公司动态政策监管Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI提议向美国政府提供5%股份,估值约426亿美元,CEO称与公众分享AI发展红利,引发行业对政企关系与监管格局的关注。
Kimi K2.7 Code 已在 GitHub Copilot 上正式发布 80
Tags:
模型发布开源生态产品集成AI编程Source:
AI HOT 精选| 阅读原文
[摘要]
Kimi K2.7 Code开源模型正式集成至GitHub Copilot,成为平台首个可选开源权重模型,为开发者提供更低成本的AI编程选择。
昆仑万维天工3.2发布Skywork Tags,AI智能体加入工作群聊 80
Tags:
智能体产品发布大模型Source:
AI HOT 精选| 阅读原文
[摘要]
昆仑万维发布天工3.2的Skywork Tags,将AI智能体接入Slack、飞书等即时通讯工具,团队可在群聊中@使用,共享版Agent持续学习表现更优,无需切换窗口或迁移数据。
BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding 80
Tags:
推理优化模型加速扩散模型大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
BlockPilot提出实例自适应策略学习,通过动态预测最优块大小来加速扩散模型投机解码,在Qwen3-4B上实现4.20倍加速,显著提升推理效率。
When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors 80
Tags:
大模型推理优化评测Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究系统评估大模型在表格任务中的数据引用错误,提出批评模型检测并减少错误,提升答案准确率最高12%。
Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues 80
Tags:
AI安全大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究揭示LLM在道德安全评估中存在“表演性合规”:明确身份标签时表现公平,但需推断身份时公平性显著下降,提出Cue Visibility Gap指标提升评估鲁棒性。
CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield 80
Tags:
研究模型压缩高效训练MoESource:
arXiv Computation and Language| 阅读原文
[摘要]
研究提出选择性监督(SGT)、深度压缩(层数压缩)与混合专家(MoEE)三种互补技术,实现2.5倍参数压缩并保持性能,为高效语言模型训练提供新路径。
AutoTrainess: Teaching Language Models to Improve Language Models Autonomously 80
Tags:
大模型训练优化智能体Source:
arXiv Computation and Language| 阅读原文
[摘要]
AutoTrainess提出通过语言模型代理自动化训练流程(规划、数据准备、训练、评估),实现语言模型自主改进,在PostTrainBench上显著超越基线。
The Bidirectional Process Reward Model 80
Tags:
过程奖励模型推理优化LLM大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出双向过程奖励模型BiPRM,通过并行右向左评估流和门控融合,仅增0.3%参数、5%延迟,在多项推理基准上显著提升质量,平均相对增益达10.6%-37.7%。
Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity? 80
Tags:
多模态模型评估不确定性估计Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出 Visual Semantic Entropy (VSE),通过仅扰动图像来估计视觉语言模型在视觉歧义下的不确定性,在多模型和基准上达到 SOTA,提升模型可靠性。