Skip to content

2026-08-18

PhoneWorld 提出可扩展手机智能体环境构建管线,利用真实轨迹生成可控环境与任务,显著提升多基准评测表现,推动手机智能体研究。 新研究提出YOPO方法,在冻结大模型的单次前向传播中同时完成回答与弃权,避免两遍推理开销,并在多个基准上显著提升准确率与跨域泛化。 提出SimpleOPD,一种与分词器无关的在线策略蒸馏方法,可将长上下文推理能力高效迁移至短上…

PhoneWorld: Scaling Phone-Use Agent Environments 80

  • Tags: 智能体 研究 移动端 基础设施

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
PhoneWorld 提出可扩展手机智能体环境构建管线,利用真实轨迹生成可控环境与任务,显著提升多基准评测表现,推动手机智能体研究。


You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model 78

  • Tags: 大模型 推理优化 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出YOPO方法,在冻结大模型的单次前向传播中同时完成回答与弃权,避免两遍推理开销,并在多个基准上显著提升准确率与跨域泛化。


SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 76

  • Tags: 模型蒸馏 长上下文 推理能力

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出SimpleOPD,一种与分词器无关的在线策略蒸馏方法,可将长上下文推理能力高效迁移至短上下文学生模型,在数学推理等基准上显著提升,如Intern-S2 Preview在ProofBench上超过Gemini-2.5-Pro。


MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement 76

  • Tags: AI研究 数学推理 大模型 训练方法

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出MathForm框架,通过知识检索与验证引导迭代优化,构建36.7万条Lean 4验证数据集并训练8B模型,在数学自动形式化基准上超越多个32B专用模型,推动数学推理与AI形式化验证发展。


Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer 75

  • Tags: 模型优化 推理优化 NVIDIA 量化部署

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
NVIDIA 发布使用 Model Optimizer 对 Nemotron 3.5 Lightning 进行 NVFP4 量化与 QAD 优化的技术方案,提升推理效率,值得开发者关注。


A 股迎来"人形机器人第一股",宇树科技官宣 8 月 19 日科创板上市 75

  • Tags: 公司动态 机器人 产业动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
宇树科技将于8月19日在科创板上市,成为“人形机器人第一股”,市值约610亿元,为全球少数盈利的通用机器人公司,标志机器人产业资本化里程碑。


NVIDIA 与 SB Energy 合作锁定俄亥俄州 PORTS-Pike 园区电力容量,OpenAI 将入驻 75

  • Tags: 芯片算力 公司动态 算力基础设施

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA与SB Energy合作锁定俄亥俄州PORTS-Pike园区电力容量,用于部署NVIDIA算力,OpenAI将作为租户入驻,凸显AI算力与电力资源布局的重要性。


  • Tags: 大模型 AI安全 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出AdaPop方法,根据事实流行度自适应调整LLM遗忘强度,相比现有方法泄露遗忘内容减少约5倍,推动模型遗忘技术发展。


GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents 75

  • Tags: 智能体 研究 LLM智能体 自我改进

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出GRASP方法,用门控回归感知的技能提议器改进LLM智能体,在临床基准上将gpt-oss-120b从40.6%提升至88.8%,显著超过现有自改进基线。


KV Cache Compression Through the Lens of Transform Coding 75

  • Tags: 推理优化 KV Cache 模型压缩 论文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出注意力感知变换编码(AATC)的KV缓存压缩方法,利用变换编码和逆向注水原理,在Llama-3.1-8B等模型上实现约5.8倍近无损压缩,显著降低长上下文推理内存瓶颈。


Qwen 3.8 27B 表现出色,但默认推理强度过高导致过度思考 75

  • Tags: 模型发布 大模型 开源生态 多模态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
阿里发布Apache 2许可的Qwen 3.8 27B视觉大模型,官方基准超越前代及闭源版本,但默认推理强度过高易致过度思考,值得开发者关注。


Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model 75

  • Tags: 模型压缩 推理优化 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出针对批量推理的免训练自适应剪枝方法,解决批量聚合激活分布偏移导致稀疏率漂移和精度崩溃问题,在DeepSeek-R1-Distill-Qwen-7B上显著提升精度并获1.40倍加速。


GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings 75

  • Tags: 大模型 强化学习 多语言 模型训练

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
大规模研究GRPO在非英语及多语言环境下的RLVR训练效果,发现母语推理训练与英语差距小且存在跨语言迁移,但需警惕特定语言能力退化。


Agentic Transaction: Towards ACID-Compliant Agent Systems 75

  • Tags: 智能体 AI安全 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出智能体事务概念,将数据库ACID属性语义化用于智能体执行,实现可靠性、一致性与并发安全,在基准测试中较Claude Code等提升10.6%。


Capacity-Dependent Effects of Data Selection for Reasoning 75

  • Tags: 模型训练 数据选择 推理 论文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示推理监督微调中基于似然的数据选择效果取决于模型容量和训练时长:小模型适合高似然数据,大模型长期训练可受益于低似然数据,为数据选择提供新视角。


From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL 75

  • Tags: AI研究 智能体 推理优化 模型训练

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出SocialRL训练方法,强化小语言模型的社会推理与谈判能力,4B模型在六个领域达到或超过GPT-5家族,并实现跨域迁移与统一策略。


Jais 2: A Family of Arabic-Centric Open Large Language Models 73

  • Tags: 模型发布 开源生态 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Jais 2是MBZUAI、Cerebras和Inception联合发布的阿拉伯语中心开源大模型系列,含70B和8B版本,高效训练且性能领先,以商业许可开源,并提供高速推理部署。


New policy ideas for the Intelligence Age 72

  • Tags: 政策监管 公司动态 AI安全

  • Source: OpenAI News | 阅读原文

[摘要]
OpenAI资助14个独立项目,探索AI政策新想法,旨在扩大经济机会并增强社会韧性,反映前沿机构对AI治理与政策布局的重视。


Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models 72

  • Tags: 语音模型 模型评测 AI安全 社会偏见

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究VQ-Bench评测语音基础模型对音质变化的敏感性,发现商业API存在基础缺陷,模型会因发声方式产生性别偏见,凸显语音AI的公平性风险。


Understanding and Mitigating Over-refusal for Large Language Models via Representation Intervention 72

  • Tags: AI安全 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
该研究从表示层分析大模型过度拒绝问题,提出表示干预方法,通过重叠感知损失加权和上下文感知增强缓解过度拒绝,平衡安全性与可用性。