Skip to content

2026-08-21

Anthropic 宣布 Claude Platform 正式上线 Computer Use、Skills API 与 Files API,并新增浏览器操作工具,使智能体可操作软件、调用团队技能并返回成品文件,标志智能体能力重要升级。 提出SPADE框架,将环境设计本身作为可学习组件,通过自博弈RL让LLM既是环境设计者又是推理代理,在数学、代码、工具使用等…

Claude Platform 正式上线 Computer Use、Skills API 与 Files API,新增浏览器操作工具 82

  • Tags: 智能体 产品发布 API 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic 宣布 Claude Platform 正式上线 Computer Use、Skills API 与 Files API,并新增浏览器操作工具,使智能体可操作软件、调用团队技能并返回成品文件,标志智能体能力重要升级。


SPADE: Self-Play in Adaptive Synthetic Executable Environments 82

  • Tags: 训练方法 强化学习 大模型 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出SPADE框架,将环境设计本身作为可学习组件,通过自博弈RL让LLM既是环境设计者又是推理代理,在数学、代码、工具使用等基准上超越最强固定环境基线,推动开放式自我改进。


消息称 OpenAI 首席财务官告知员工:公司最迟将于 2027 年上市 82

  • Tags: 公司动态 OpenAI IPO

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI首席财务官告知员工,公司最迟将于2027年上市,已秘密提交IPO招股书,企业级营收增长50%,AI编程与办公产品周活破2000万,标志其商业化进入新阶段。


LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum 80

  • Tags: 模型发布 信息检索 开源生态 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文提出LACONIC,基于Llama3的稀疏检索模型,通过两阶段训练达到60.2 nDCG@10,接近稠密模型且索引内存减少74%,并开源代码与权重。


Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍 78

  • Tags: 推理优化 开源生态 模型发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,通过投机解码将 GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍,函数调用延迟降低 57%,已开源支持 llama.cpp 和 SGLang。


AlloyDB ScaNN 如何将向量搜索扩展到 100 亿向量 78

  • Tags: 向量搜索 数据库 推理优化 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google AlloyDB推出ScaNN四层树索引,支持百亿级向量搜索,查询复杂度降至O(N^1/4),p95延迟51毫秒,显著提升向量数据库扩展性。


Neurosymbolic Embodied Agents 78

  • Tags: 具身智能 模型发布 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出神经符号具身智能体,结合视觉探索与PDDL约束规划和蒙特卡洛树搜索,在VirtualHome和ALFWorld上以4B-27B开源模型实现超90%成功率,小模型优于27B直接视觉策略,规划可执行性显著提升。


Jailbreaking in the Haystack 78

  • Tags: AI安全 长上下文 越狱攻击 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出NINJA越狱攻击,通过在长上下文中把有害目标置于无害内容间,显著提高对齐大模型的攻击成功率,揭示长上下文模型存在根本安全漏洞。


Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck 78

  • Tags: 推理优化 大模型 测试时扩展 模型评测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究对比五种测试时扩展方法在开放式生成任务上的表现,发现候选池质量提升但选择机制是瓶颈,奖励模型与真实质量相关性极低,仅候选融合稳定有效,对推理优化有重要启示。


How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks 78

  • Tags: 智能体 模型评测 研究评估

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
介绍AutoResearchEval与ARFT,对100个真实前沿科研任务评估8种智能体组合,揭示其缺乏元认知循环并系统化故障模式,为自主科研提供诊断基准。


Accurate Decoding of Natural Sentences from Non-Invasive Brain Recordings 78

  • Tags: 脑机接口 研究进展 大模型应用

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究发布Brain2Qwerty v2,利用非侵入式脑磁图记录解码自然语句,平均词错误率39%,性能随数据量对数提升,表明非侵入式脑机接口正接近植入式水平,AI在其中起关键作用。


Anthropic 在网络关键能力时代放缓模型开发:暂停 RL 训练并强化安全防护 78

  • Tags: AI安全 公司动态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic 担心下一代模型(如 Astra)可能达到关键网络安全能力阈值,因此暂停最新模型两周的强化学习训练,并加强研究环境安全隔离与思维链监控,凸显前沿 AI 安全权衡。


Self- and Other-Labels Induce Bidirectional Bias in LLM Judges 78

  • Tags: AI安全 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示LLM作为裁判时,自我标签和他人标签会导致双向评分偏差,并发现作者身份归属是评估偏差的独立驱动因素,对AI评估可靠性有重要警示。


Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS) 78

  • Tags: AI安全 模型偏见 研究论文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文提出MECSS框架量化大模型对中东文化的结构性偏见,发现GPT-4和Falcon3均系统性复现东方主义模式,区域训练无法自动消除偏见,对AI公平性研究有参考价值。


阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕 75

  • Tags: 大模型 智能体 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
阿里巴巴发布 Qwen-UI-Agent,一个面向真实世界的GUI智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索环境,推动智能体在屏幕交互场景中的应用。


Self-Improvement of Large Language Models: A Technical Overview and Future Outlook 75

  • Tags: 大模型 研究综述 模型进化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
系统性综述大语言模型自我改进技术,提出数据获取、选择、优化与推理精炼的闭环框架,并探讨自主评估与未来方向,对理解LLM自动化演进有参考价值。


Future Policy Approximation for Offline Reinforcement Learning in LLM Reasoning 75

  • Tags: 强化学习 大模型 推理优化 离线RL

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出未来策略近似(FPA)的离线策略梯度方法,解决推理轨迹中梯度纠缠问题,在数学和代码基准上超越多个离线基线,并接近在线RLVR方法且计算开销更低。


Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models 75

  • Tags: 多模态 音频语言模型 模型训练 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出无需指令的纯对齐训练方法,仅训练轻量投影层即可构建通用音频语言模型,冻结音频编码器和LLM,性能匹敌甚至超过重后训练基线,显著降低多模态扩展成本。


Mistral 推出 Agentic Search:多步检索提升 AI 系统复杂文档查询准确率 72

  • Tags: 智能体 检索增强 模型发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Mistral 发布 Agentic Search,通过多工具多步检索循环,提升 AI 系统在长文档和多来源中的复杂查询准确率,值得关注。


EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding 72

  • Tags: 基准测试 多模态 视频理解 AI研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准EgoMemReason评估智能眼镜等长程第一视角视频中的三类记忆推理能力,显示最强模型准确率仅39.6%,揭示长期记忆仍是未解难题。