Skip to content

2026-08-23

第二届世界人形机器人运动会开幕,2056台机器人参赛,天工Ultra百米跑出9.39秒破人类纪录,多项赛事全自主运行,展示人形机器人运动能力重大进展。 蚂蚁百灵为SGLang推出权重缓存守护进程,将Ling-2.6-1T FP8模型权重加载时间缩短至约0.63秒,比磁盘加载快约780倍,引擎启动时间从8.8分钟降至0.53分钟,显著提升大模型部署效率。 研究…

第二届世界人形机器人运动会开幕:2056 台机器人齐聚"冰丝带",666 支队伍竞技 51 赛项 75

  • Tags: 机器人 人形机器人 产业动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
第二届世界人形机器人运动会开幕,2056台机器人参赛,天工Ultra百米跑出9.39秒破人类纪录,多项赛事全自主运行,展示人形机器人运动能力重大进展。


蚂蚁百灵为SGLang推出权重缓存守护进程 75

  • Tags: 推理优化 模型部署 开源生态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
蚂蚁百灵为SGLang推出权重缓存守护进程,将Ling-2.6-1T FP8模型权重加载时间缩短至约0.63秒,比磁盘加载快约780倍,引擎启动时间从8.8分钟降至0.53分钟,显著提升大模型部署效率。


The Asymmetric Harms of LLM Compression 70

  • Tags: 模型压缩 AI安全 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示LLM压缩在知识保留、置信度和社会偏见上存在不对称影响,标准指标掩盖行为变化,强调部署前需细粒度评估。


From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG 65

  • Tags: 推理优化 边缘计算 RAG

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文提出边缘RAG中基于遥测的自适应上下文压缩方法,实验显示中等压缩可降低GPU能耗53.2%且质量损失小,为边缘推理优化提供新思路。


Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization 65

  • Tags: 研究 训练方法 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 IAR 三阶段后训练框架,将文档知识内化为参数知识,提升无检索问答的领域准确率并保持通用能力,在多个模型上平均提升3.6个百分点。


b10580 62

  • Tags: 开源生态 多模态 推理优化

  • Source: GitHub Release - llama.cpp | 阅读原文

[摘要]
llama.cpp 新增对 dots3-note 视觉+音频模型的支持,扩展了多模态推理能力,对本地部署生态有积极意义。


Where Security Fits in an AI Agent Stack 62

  • Tags: AI安全 智能体

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
文章探讨AI智能体栈中安全与信任的重要性,随着智能体能力增强、运行周期变长,安全设计成为关键,对开发者构建可靠智能体应用有参考价值。


From Atari to EVE Online: Building on 15 Years of AI Research in Games 62

  • Tags: 公司动态 AI研究 游戏AI

  • Source: Google DeepMind Blog | 阅读原文

[摘要]
Google DeepMind与游戏工作室合作,将15年游戏AI研究应用于原型开发,探索AI在游戏中的突破性玩法,体现AI与游戏产业深度融合。


When Contextual Inference Fails: Cancelability in Interactive Instruction Following 62

  • Tags: 智能体 评测基准 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准BWIM测试大模型在交互式指令跟随中的语境推断与澄清能力,发现模型虽能识别说话者不可靠,但行动时未能有效利用,存在过度澄清或盲目猜测问题,对智能体交互研究有价值。


Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation 62

  • Tags: 推理优化 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出高效估算文本生成不确定性动态的方法,通过统计平滑降低重采样成本,揭示不确定性模式主要源于采样噪声,有助于推理分析优化。


TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling 62

  • Tags: AI安全 多模态 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出TempJail,利用字幕时间调度对大型视觉语言模型实施视频越狱攻击,在GPT-5等模型上成功率大幅提升,揭示时间维度安全漏洞。


Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design 62

  • Tags: 智能体 推理优化 多智能体系统

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出RGA-Designer,通过奖励引导的自回归图生成优化多智能体通信拓扑,在保持任务准确率的同时平均减少20.5%的token消耗,提升LLM多智能体系统效率。


Asymmetric Attention Heads: Structured Head-Wise Context Allocation for Transformer Attention 62

  • Tags: 研究 注意力机制 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出非对称注意力头(AAH)框架,按头分配不同上下文窗口长度,在4096 token实验中部分变体验证损失低于全注意力,为注意力机制优化提供新思路。


Are LLMs becoming similarly creative? Evidence from three years of models 62

  • Tags: 大模型 AI安全 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究分析三年间LLM在开放式创意任务中的表现,发现模型输出多样性随时间显著下降,可能趋于同质化,影响人机协同创作,值得关注。


Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment 62

  • Tags: 多模态 医学影像 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出医学图像描述框架,通过多编码器、概念辅助学习及推理重排和强化学习增强临床对齐,提升可信度,对医疗AI可解释性有参考价值。


Linguistic Holonomy and Statistical Watermarks: Inner Geometry of Meaning-Preserving Transformations 62

  • Tags: AI安全 研究 水印

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新论文提出用语言学环路形式化分析统计水印在保持语义变换下的衰减,证明端点相似度不足以衡量,需考虑环路和乐律,并给出精确衰减定律。


Represented but Ignored: A Causal Account of Prosodic Underuse in Audio-Language Models 62

  • Tags: 多模态 模型研究 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究揭示音频语言模型在韵律理解上的瓶颈:模型能感知并内部表征韵律信息,但最终回答中未能充分表达,通过隐藏状态干预可部分恢复,为改进多模态模型提供新视角。


Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents 62

  • Tags: 智能体 模型评测 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出MCB基准,评估LLM智能体在持久记忆与澄清边界上的决策能力,发现模型验证事实优于主动询问,提示词可提升准确性但澄清召回仍低,对智能体记忆设计有参考价值。


When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models 62

  • Tags: 大模型 研究进展 结构化预测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出UniLang框架,扩展预训练大模型词汇与嵌入空间,将机器原生符号作为生成单元与自然语言联合建模,在序列推荐和法律预测任务上超越基线,为结构化预测提供统一方案。


MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents 62

  • Tags: 智能体 强化学习 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出MileGPO方法,通过里程碑发现与可靠性校准改进长程智能体强化学习的信用分配,在ALFWorld和WebShop上达到SOTA,无需辅助模型或额外交互,对智能体训练有参考价值。