2026-07-19
针对扩散语言模型推理效率的两大挑战(KV-cache复用和并行解码质量),提出无训练框架Polestar,利用token表示漂移信号统一优化,在数学和编程任务上实现最高10.73%精度提升和3.7倍吞吐量提升。 论文从数据偏好典型性偏差解释大模型对齐中的模式崩溃,提出无训练的Verbalized Sampling策略,在创意写作等任务中提升多样性1.6-2.…
Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs 80
Tags:
推理优化模型推理大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
针对扩散语言模型推理效率的两大挑战(KV-cache复用和并行解码质量),提出无训练框架Polestar,利用token表示漂移信号统一优化,在数学和编程任务上实现最高10.73%精度提升和3.7倍吞吐量提升。
Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity 80
Tags:
大模型研究推理优化AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文从数据偏好典型性偏差解释大模型对齐中的模式崩溃,提出无训练的Verbalized Sampling策略,在创意写作等任务中提升多样性1.6-2.1倍,保持准确性。
Step-Tagging: Toward controlling the generation of Language Reasoning Models through step monitoring 80
Tags:
推理优化模型优化可解释性Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Step-Tagging框架,通过实时标注推理步骤类型实现LRM生成监控与早停,节省20-50% token且保持精度,提升推理效率。
Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization 80
Tags:
强化学习训练方法模型优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出对比策略优化(CPO),利用对比散度进行正确性感知的优势塑造,显著提升强化学习可验证奖励(RLVR)方法性能并解决零优势问题。
On-Policy Delta Distillation 80
Tags:
训练方法推理优化模型发布开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出基于delta信号的策略蒸馏方法OPD²,在数学、科学、代码推理基准上优于传统策略蒸馏,显著提升推理能力迁移效率,属重要训练方法突破。
Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy 80
Tags:
多模态大模型基准测试科学可视化模型评估Source:
arXiv Computation and Language| 阅读原文
[摘要]
多模态大模型科学可视化素养基准:评估6个模型在49项测试上的表现,Gemini超人类均值,开源模型低于基线,暴露细粒度定量估计等弱点。
xHC: Expanded Hyper-Connections 80
Tags:
大模型训练方法推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Expanded Hyper-Connections (xHC),突破超连接扩展瓶颈,在18B MoE上比mHC提升4.0分,并设计xHC-Flash减少内存流量,使大规模残差流扩展实用化。
SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning 80
Tags:
多模态模型训练推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
SD-MAR提出用合成数据与强化学习增强多图像分析推理,在多个基准上显著提升VLM性能,开源方法有助于提升多模态推理能力。
Empirical evidence of Large Language Model's influence on human spoken communication 80
Tags:
大模型AI安全社会影响Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究证实ChatGPT等大模型的语言偏好(如'delve'等词汇)已显著影响人类口语,实验表明人们会内化模型用词并持续使用,反映AI正重塑文化进化,引发语言同质化担忧。
Mixtures of SubExperts for Large Language Continual Learning 80
Tags:
研究进展持续学习模型架构Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出 Mixtures of SubExperts (MoSEs) 模块化稀疏框架,通过子专家与路由机制解决大模型持续学习中的稳定性-可塑性困境,在 TRACE 和 SuperNI 上实现 SOTA,减少遗忘并提升参数效率。
Information-Theoretic Limits of Reliability and Scaling in Language Models 80
Tags:
大模型理论研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
信息论研究表明,语言模型存在可靠性上限,不能仅靠增大规模突破,并推导出新的扩展规律。
OpenAI 提出 AI 时代记分卡:"有用智能每美元"衡量实际工作价值 78
Tags:
大模型公司动态产业标准Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI 提出“有用智能每美元”指标,从工作量、成本、可靠性三维度衡量AI投资回报,为行业评估提供新标准。
生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格 78
Tags:
芯片算力产业动态硬件市场Source:
AI HOT 精选| 阅读原文
[摘要]
AI公司为维持大模型运行,抢购全球70%高端内存,推高内存价格并导致电脑涨价,预测平价入门级电脑或于2028年前消失。
The Severance Problem: LLMs are Unaware of the Person Beyond the Prompt 78
Tags:
AI安全大模型研究发布推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究指出大语言模型因缺乏对用户的显式表征导致谄媚、过度自信等问题,提出"Severance Schema"引入结构化无知,实验证明可减少有害建议和幻觉,提升可靠性。
Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models 78
Tags:
推理优化模型训练LLMSource:
arXiv Computation and Language| 阅读原文
[摘要]
论文揭示答案条件化思维链生成会降低大模型推理蒸馏质量,即使正确性过滤也无法修复,建议采用答案盲生成以提升可验证推理能力。
Escaping Model Collapse via Synthetic Data Verification: Near-term Improvements and Long-term Convergence 78
Tags:
模型训练模型崩溃合成数据Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
研究提出通过外部验证器引导合成数据重新训练,可避免模型崩溃并实现短期改进,但长期收敛于验证器知识中心,实验验证了理论预测。
Mask-Aware Policy Gradients for Diffusion Language Models 78
Tags:
大模型强化学习推理优化扩散模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出掩码感知策略梯度方法,将扩散语言模型生成过程建模为两阶段动作MDP,在GSM8K和MBPP上取得87.1%和53.4%的SOTA结果,提升数学推理与代码生成。
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning 78
Tags:
智能体强化学习训练方法大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出 SEED 框架,通过自进化在线策略蒸馏将完整轨迹转化为事后技能并注入策略,提升大模型智能体在长程任务上的强化学习效果与样本效率。
MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning 78
Tags:
机器人智能体推理规划具身智能Source:
arXiv Computation and Language| 阅读原文
[摘要]
MEMORA 提出基于自我中心视频的具身动作记忆,通过四类记忆存储和在线编辑、离线整合机制,提升机器人长时程规划与记忆评估准确率,实验在 EPIC-KITCHENS 数据集上达到显著效果。
Apple 起诉 OpenAI:诉讼背后是竞争焦虑还是时机博弈? 75
Tags:
公司动态政策监管AI安全Source:
AI HOT 精选| 阅读原文
[摘要]
Apple对OpenAI提起诉讼,指控不当行为;外界猜测此举或为竞争焦虑,或利用OpenAI弱势期,引发行业关注。