Skip to content

2026-07-19

针对扩散语言模型推理效率的两大挑战(KV-cache复用和并行解码质量),提出无训练框架Polestar,利用token表示漂移信号统一优化,在数学和编程任务上实现最高10.73%精度提升和3.7倍吞吐量提升。 论文从数据偏好典型性偏差解释大模型对齐中的模式崩溃,提出无训练的Verbalized Sampling策略,在创意写作等任务中提升多样性1.6-2.…

Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs 80

  • Tags: 推理优化 模型推理 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
针对扩散语言模型推理效率的两大挑战(KV-cache复用和并行解码质量),提出无训练框架Polestar,利用token表示漂移信号统一优化,在数学和编程任务上实现最高10.73%精度提升和3.7倍吞吐量提升。


Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity 80

  • Tags: 大模型 研究 推理优化 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文从数据偏好典型性偏差解释大模型对齐中的模式崩溃,提出无训练的Verbalized Sampling策略,在创意写作等任务中提升多样性1.6-2.1倍,保持准确性。


Step-Tagging: Toward controlling the generation of Language Reasoning Models through step monitoring 80

  • Tags: 推理优化 模型优化 可解释性

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Step-Tagging框架,通过实时标注推理步骤类型实现LRM生成监控与早停,节省20-50% token且保持精度,提升推理效率。


Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization 80

  • Tags: 强化学习 训练方法 模型优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出对比策略优化(CPO),利用对比散度进行正确性感知的优势塑造,显著提升强化学习可验证奖励(RLVR)方法性能并解决零优势问题。


On-Policy Delta Distillation 80

  • Tags: 训练方法 推理优化 模型发布 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出基于delta信号的策略蒸馏方法OPD²,在数学、科学、代码推理基准上优于传统策略蒸馏,显著提升推理能力迁移效率,属重要训练方法突破。


Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy 80

  • Tags: 多模态大模型 基准测试 科学可视化 模型评估

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
多模态大模型科学可视化素养基准:评估6个模型在49项测试上的表现,Gemini超人类均值,开源模型低于基线,暴露细粒度定量估计等弱点。


xHC: Expanded Hyper-Connections 80

  • Tags: 大模型 训练方法 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Expanded Hyper-Connections (xHC),突破超连接扩展瓶颈,在18B MoE上比mHC提升4.0分,并设计xHC-Flash减少内存流量,使大规模残差流扩展实用化。


SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning 80

  • Tags: 多模态 模型训练 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
SD-MAR提出用合成数据与强化学习增强多图像分析推理,在多个基准上显著提升VLM性能,开源方法有助于提升多模态推理能力。


Empirical evidence of Large Language Model's influence on human spoken communication 80

  • Tags: 大模型 AI安全 社会影响

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究证实ChatGPT等大模型的语言偏好(如'delve'等词汇)已显著影响人类口语,实验表明人们会内化模型用词并持续使用,反映AI正重塑文化进化,引发语言同质化担忧。


Mixtures of SubExperts for Large Language Continual Learning 80

  • Tags: 研究进展 持续学习 模型架构

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 Mixtures of SubExperts (MoSEs) 模块化稀疏框架,通过子专家与路由机制解决大模型持续学习中的稳定性-可塑性困境,在 TRACE 和 SuperNI 上实现 SOTA,减少遗忘并提升参数效率。


Information-Theoretic Limits of Reliability and Scaling in Language Models 80

  • Tags: 大模型 理论研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
信息论研究表明,语言模型存在可靠性上限,不能仅靠增大规模突破,并推导出新的扩展规律。


OpenAI 提出 AI 时代记分卡:"有用智能每美元"衡量实际工作价值 78

  • Tags: 大模型 公司动态 产业标准

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI 提出“有用智能每美元”指标,从工作量、成本、可靠性三维度衡量AI投资回报,为行业评估提供新标准。


生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格 78

  • Tags: 芯片算力 产业动态 硬件市场

  • Source: AI HOT 精选 | 阅读原文

[摘要]
AI公司为维持大模型运行,抢购全球70%高端内存,推高内存价格并导致电脑涨价,预测平价入门级电脑或于2028年前消失。


The Severance Problem: LLMs are Unaware of the Person Beyond the Prompt 78

  • Tags: AI安全 大模型 研究发布 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究指出大语言模型因缺乏对用户的显式表征导致谄媚、过度自信等问题,提出"Severance Schema"引入结构化无知,实验证明可减少有害建议和幻觉,提升可靠性。


Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models 78

  • Tags: 推理优化 模型训练 LLM

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文揭示答案条件化思维链生成会降低大模型推理蒸馏质量,即使正确性过滤也无法修复,建议采用答案盲生成以提升可验证推理能力。


Escaping Model Collapse via Synthetic Data Verification: Near-term Improvements and Long-term Convergence 78

  • Tags: 模型训练 模型崩溃 合成数据

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
研究提出通过外部验证器引导合成数据重新训练,可避免模型崩溃并实现短期改进,但长期收敛于验证器知识中心,实验验证了理论预测。


Mask-Aware Policy Gradients for Diffusion Language Models 78

  • Tags: 大模型 强化学习 推理优化 扩散模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出掩码感知策略梯度方法,将扩散语言模型生成过程建模为两阶段动作MDP,在GSM8K和MBPP上取得87.1%和53.4%的SOTA结果,提升数学推理与代码生成。


SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning 78

  • Tags: 智能体 强化学习 训练方法 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 SEED 框架,通过自进化在线策略蒸馏将完整轨迹转化为事后技能并注入策略,提升大模型智能体在长程任务上的强化学习效果与样本效率。


MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning 78

  • Tags: 机器人 智能体 推理规划 具身智能

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
MEMORA 提出基于自我中心视频的具身动作记忆,通过四类记忆存储和在线编辑、离线整合机制,提升机器人长时程规划与记忆评估准确率,实验在 EPIC-KITCHENS 数据集上达到显著效果。


Apple 起诉 OpenAI:诉讼背后是竞争焦虑还是时机博弈? 75

  • Tags: 公司动态 政策监管 AI安全

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Apple对OpenAI提起诉讼,指控不当行为;外界猜测此举或为竞争焦虑,或利用OpenAI弱势期,引发行业关注。