2026-08-18
PhoneWorld 提出可扩展手机智能体环境构建管线,利用真实轨迹生成可控环境与任务,显著提升多基准评测表现,推动手机智能体研究。 新研究提出YOPO方法,在冻结大模型的单次前向传播中同时完成回答与弃权,避免两遍推理开销,并在多个基准上显著提升准确率与跨域泛化。 提出SimpleOPD,一种与分词器无关的在线策略蒸馏方法,可将长上下文推理能力高效迁移至短上…
PhoneWorld: Scaling Phone-Use Agent Environments 80
Tags:
智能体研究移动端基础设施Source:
arXiv Computation and Language| 阅读原文
[摘要]
PhoneWorld 提出可扩展手机智能体环境构建管线,利用真实轨迹生成可控环境与任务,显著提升多基准评测表现,推动手机智能体研究。
You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model 78
Tags:
大模型推理优化AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出YOPO方法,在冻结大模型的单次前向传播中同时完成回答与弃权,避免两遍推理开销,并在多个基准上显著提升准确率与跨域泛化。
SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 76
Tags:
模型蒸馏长上下文推理能力Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出SimpleOPD,一种与分词器无关的在线策略蒸馏方法,可将长上下文推理能力高效迁移至短上下文学生模型,在数学推理等基准上显著提升,如Intern-S2 Preview在ProofBench上超过Gemini-2.5-Pro。
MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement 76
Tags:
AI研究数学推理大模型训练方法Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出MathForm框架,通过知识检索与验证引导迭代优化,构建36.7万条Lean 4验证数据集并训练8B模型,在数学自动形式化基准上超越多个32B专用模型,推动数学推理与AI形式化验证发展。
Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer 75
Tags:
模型优化推理优化NVIDIA量化部署Source:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
NVIDIA 发布使用 Model Optimizer 对 Nemotron 3.5 Lightning 进行 NVFP4 量化与 QAD 优化的技术方案,提升推理效率,值得开发者关注。
A 股迎来"人形机器人第一股",宇树科技官宣 8 月 19 日科创板上市 75
Tags:
公司动态机器人产业动态Source:
AI HOT 精选| 阅读原文
[摘要]
宇树科技将于8月19日在科创板上市,成为“人形机器人第一股”,市值约610亿元,为全球少数盈利的通用机器人公司,标志机器人产业资本化里程碑。
NVIDIA 与 SB Energy 合作锁定俄亥俄州 PORTS-Pike 园区电力容量,OpenAI 将入驻 75
Tags:
芯片算力公司动态算力基础设施Source:
AI HOT 精选| 阅读原文
[摘要]
NVIDIA与SB Energy合作锁定俄亥俄州PORTS-Pike园区电力容量,用于部署NVIDIA算力,OpenAI将作为租户入驻,凸显AI算力与电力资源布局的重要性。
The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning 75
Tags:
大模型AI安全研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出AdaPop方法,根据事实流行度自适应调整LLM遗忘强度,相比现有方法泄露遗忘内容减少约5倍,推动模型遗忘技术发展。
GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents 75
Tags:
智能体研究LLM智能体自我改进Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出GRASP方法,用门控回归感知的技能提议器改进LLM智能体,在临床基准上将gpt-oss-120b从40.6%提升至88.8%,显著超过现有自改进基线。
KV Cache Compression Through the Lens of Transform Coding 75
Tags:
推理优化KV Cache模型压缩论文Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出注意力感知变换编码(AATC)的KV缓存压缩方法,利用变换编码和逆向注水原理,在Llama-3.1-8B等模型上实现约5.8倍近无损压缩,显著降低长上下文推理内存瓶颈。
Qwen 3.8 27B 表现出色,但默认推理强度过高导致过度思考 75
Tags:
模型发布大模型开源生态多模态Source:
AI HOT 精选| 阅读原文
[摘要]
阿里发布Apache 2许可的Qwen 3.8 27B视觉大模型,官方基准超越前代及闭源版本,但默认推理强度过高易致过度思考,值得开发者关注。
Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model 75
Tags:
模型压缩推理优化大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出针对批量推理的免训练自适应剪枝方法,解决批量聚合激活分布偏移导致稀疏率漂移和精度崩溃问题,在DeepSeek-R1-Distill-Qwen-7B上显著提升精度并获1.40倍加速。
GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings 75
Tags:
大模型强化学习多语言模型训练Source:
arXiv Computation and Language| 阅读原文
[摘要]
大规模研究GRPO在非英语及多语言环境下的RLVR训练效果,发现母语推理训练与英语差距小且存在跨语言迁移,但需警惕特定语言能力退化。
Agentic Transaction: Towards ACID-Compliant Agent Systems 75
Tags:
智能体AI安全研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出智能体事务概念,将数据库ACID属性语义化用于智能体执行,实现可靠性、一致性与并发安全,在基准测试中较Claude Code等提升10.6%。
Capacity-Dependent Effects of Data Selection for Reasoning 75
Tags:
模型训练数据选择推理论文Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究揭示推理监督微调中基于似然的数据选择效果取决于模型容量和训练时长:小模型适合高似然数据,大模型长期训练可受益于低似然数据,为数据选择提供新视角。
From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL 75
Tags:
AI研究智能体推理优化模型训练Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出SocialRL训练方法,强化小语言模型的社会推理与谈判能力,4B模型在六个领域达到或超过GPT-5家族,并实现跨域迁移与统一策略。
Jais 2: A Family of Arabic-Centric Open Large Language Models 73
Tags:
模型发布开源生态大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
Jais 2是MBZUAI、Cerebras和Inception联合发布的阿拉伯语中心开源大模型系列,含70B和8B版本,高效训练且性能领先,以商业许可开源,并提供高速推理部署。
New policy ideas for the Intelligence Age 72
Tags:
政策监管公司动态AI安全Source:
OpenAI News| 阅读原文
[摘要]
OpenAI资助14个独立项目,探索AI政策新想法,旨在扩大经济机会并增强社会韧性,反映前沿机构对AI治理与政策布局的重视。
Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models 72
Tags:
语音模型模型评测AI安全社会偏见Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究VQ-Bench评测语音基础模型对音质变化的敏感性,发现商业API存在基础缺陷,模型会因发声方式产生性别偏见,凸显语音AI的公平性风险。
Understanding and Mitigating Over-refusal for Large Language Models via Representation Intervention 72
Tags:
AI安全大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
该研究从表示层分析大模型过度拒绝问题,提出表示干预方法,通过重叠感知损失加权和上下文感知增强缓解过度拒绝,平衡安全性与可用性。