2026-08-21
Anthropic 宣布 Claude Platform 正式上线 Computer Use、Skills API 与 Files API,并新增浏览器操作工具,使智能体可操作软件、调用团队技能并返回成品文件,标志智能体能力重要升级。 提出SPADE框架,将环境设计本身作为可学习组件,通过自博弈RL让LLM既是环境设计者又是推理代理,在数学、代码、工具使用等…
Claude Platform 正式上线 Computer Use、Skills API 与 Files API,新增浏览器操作工具 82
Tags:
智能体产品发布API公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
Anthropic 宣布 Claude Platform 正式上线 Computer Use、Skills API 与 Files API,并新增浏览器操作工具,使智能体可操作软件、调用团队技能并返回成品文件,标志智能体能力重要升级。
SPADE: Self-Play in Adaptive Synthetic Executable Environments 82
Tags:
训练方法强化学习大模型智能体Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出SPADE框架,将环境设计本身作为可学习组件,通过自博弈RL让LLM既是环境设计者又是推理代理,在数学、代码、工具使用等基准上超越最强固定环境基线,推动开放式自我改进。
消息称 OpenAI 首席财务官告知员工:公司最迟将于 2027 年上市 82
Tags:
公司动态OpenAIIPOSource:
AI HOT 精选| 阅读原文
[摘要]
OpenAI首席财务官告知员工,公司最迟将于2027年上市,已秘密提交IPO招股书,企业级营收增长50%,AI编程与办公产品周活破2000万,标志其商业化进入新阶段。
LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum 80
Tags:
模型发布信息检索开源生态推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文提出LACONIC,基于Llama3的稀疏检索模型,通过两阶段训练达到60.2 nDCG@10,接近稠密模型且索引内存减少74%,并开源代码与权重。
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍 78
Tags:
推理优化开源生态模型发布Source:
AI HOT 精选| 阅读原文
[摘要]
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,通过投机解码将 GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍,函数调用延迟降低 57%,已开源支持 llama.cpp 和 SGLang。
AlloyDB ScaNN 如何将向量搜索扩展到 100 亿向量 78
Tags:
向量搜索数据库推理优化产品发布Source:
AI HOT 精选| 阅读原文
[摘要]
Google AlloyDB推出ScaNN四层树索引,支持百亿级向量搜索,查询复杂度降至O(N^1/4),p95延迟51毫秒,显著提升向量数据库扩展性。
Neurosymbolic Embodied Agents 78
Tags:
具身智能模型发布智能体Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出神经符号具身智能体,结合视觉探索与PDDL约束规划和蒙特卡洛树搜索,在VirtualHome和ALFWorld上以4B-27B开源模型实现超90%成功率,小模型优于27B直接视觉策略,规划可执行性显著提升。
Jailbreaking in the Haystack 78
Tags:
AI安全长上下文越狱攻击研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出NINJA越狱攻击,通过在长上下文中把有害目标置于无害内容间,显著提高对齐大模型的攻击成功率,揭示长上下文模型存在根本安全漏洞。
Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck 78
Tags:
推理优化大模型测试时扩展模型评测Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究对比五种测试时扩展方法在开放式生成任务上的表现,发现候选池质量提升但选择机制是瓶颈,奖励模型与真实质量相关性极低,仅候选融合稳定有效,对推理优化有重要启示。
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks 78
Tags:
智能体模型评测研究评估Source:
arXiv Computation and Language| 阅读原文
[摘要]
介绍AutoResearchEval与ARFT,对100个真实前沿科研任务评估8种智能体组合,揭示其缺乏元认知循环并系统化故障模式,为自主科研提供诊断基准。
Accurate Decoding of Natural Sentences from Non-Invasive Brain Recordings 78
Tags:
脑机接口研究进展大模型应用Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究发布Brain2Qwerty v2,利用非侵入式脑磁图记录解码自然语句,平均词错误率39%,性能随数据量对数提升,表明非侵入式脑机接口正接近植入式水平,AI在其中起关键作用。
Anthropic 在网络关键能力时代放缓模型开发:暂停 RL 训练并强化安全防护 78
Tags:
AI安全公司动态大模型Source:
AI HOT 精选| 阅读原文
[摘要]
Anthropic 担心下一代模型(如 Astra)可能达到关键网络安全能力阈值,因此暂停最新模型两周的强化学习训练,并加强研究环境安全隔离与思维链监控,凸显前沿 AI 安全权衡。
Self- and Other-Labels Induce Bidirectional Bias in LLM Judges 78
Tags:
AI安全大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究揭示LLM作为裁判时,自我标签和他人标签会导致双向评分偏差,并发现作者身份归属是评估偏差的独立驱动因素,对AI评估可靠性有重要警示。
Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS) 78
Tags:
AI安全模型偏见研究论文Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文提出MECSS框架量化大模型对中东文化的结构性偏见,发现GPT-4和Falcon3均系统性复现东方主义模式,区域训练无法自动消除偏见,对AI公平性研究有参考价值。
阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕 75
Tags:
大模型智能体产品发布Source:
AI HOT 精选| 阅读原文
[摘要]
阿里巴巴发布 Qwen-UI-Agent,一个面向真实世界的GUI智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索环境,推动智能体在屏幕交互场景中的应用。
Self-Improvement of Large Language Models: A Technical Overview and Future Outlook 75
Tags:
大模型研究综述模型进化Source:
arXiv Computation and Language| 阅读原文
[摘要]
系统性综述大语言模型自我改进技术,提出数据获取、选择、优化与推理精炼的闭环框架,并探讨自主评估与未来方向,对理解LLM自动化演进有参考价值。
Future Policy Approximation for Offline Reinforcement Learning in LLM Reasoning 75
Tags:
强化学习大模型推理优化离线RLSource:
arXiv Computation and Language| 阅读原文
[摘要]
提出未来策略近似(FPA)的离线策略梯度方法,解决推理轨迹中梯度纠缠问题,在数学和代码基准上超越多个离线基线,并接近在线RLVR方法且计算开销更低。
Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models 75
Tags:
多模态音频语言模型模型训练研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出无需指令的纯对齐训练方法,仅训练轻量投影层即可构建通用音频语言模型,冻结音频编码器和LLM,性能匹敌甚至超过重后训练基线,显著降低多模态扩展成本。
Mistral 推出 Agentic Search:多步检索提升 AI 系统复杂文档查询准确率 72
Tags:
智能体检索增强模型发布Source:
AI HOT 精选| 阅读原文
[摘要]
Mistral 发布 Agentic Search,通过多工具多步检索循环,提升 AI 系统在长文档和多来源中的复杂查询准确率,值得关注。
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding 72
Tags:
基准测试多模态视频理解AI研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准EgoMemReason评估智能眼镜等长程第一视角视频中的三类记忆推理能力,显示最强模型准确率仅39.6%,揭示长期记忆仍是未解难题。