Skip to content

2026-07-16

提出Ring-Zero方法,将零强化学习扩展到万亿参数模型,通过稳定训练管线提升数学推理性能,并观察到拟人化、自验证等涌现能力,为大规模RL提供新见解。 提出Knowledgeless语言模型(KLLMs),通过匿名化实体削弱参数记忆,使模型更依赖上下文证据,在检索增强任务中相对提升20-25%,减少幻觉并改善校准。 阿里通义实验室发布实时语音交互模型Qwe…

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning 95

  • Tags: 大模型 研究突破 强化学习 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Ring-Zero方法,将零强化学习扩展到万亿参数模型,通过稳定训练管线提升数学推理性能,并观察到拟人化、自验证等涌现能力,为大规模RL提供新见解。


Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling 85

  • Tags: 研究 大模型 训练方法 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Knowledgeless语言模型(KLLMs),通过匿名化实体削弱参数记忆,使模型更依赖上下文证据,在检索增强任务中相对提升20-25%,减少幻觉并改善校准。


阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一 85

  • Tags: 模型发布 语音交互 阿里 实时模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
阿里通义实验室发布实时语音交互模型Qwen-Audio-3.0-Realtime,在语音推理评测中超越OpenAI GPT-Realtime-2排名第一,标志着国产语音模型取得重要突破。


Cursor IDE 0day 漏洞:打开恶意仓库即可自动执行任意代码 85

  • Tags: AI安全 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Cursor IDE存在严重0day漏洞,打开恶意仓库即可自动执行任意代码,影响大量开发者,需及时缓解。


Triton Plugin Extensions: Enabling TLX and Custom Compiler Passes Out of the Box 82

  • Tags: 推理优化 开源生态 PyTorch 芯片算力

  • Source: PyTorch Blog | 阅读原文

[摘要]
PyTorch-Triton 3.7 发布 Triton Plugin Extensions 系统,支持动态加载自定义编译器 pass 与 DSL 扩展,大幅提升 GPU 算子开发的灵活性与生态兼容性。


Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution 82

  • Tags: 智能体 推理优化 模型评测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出任务感知执行估计方法E3,使AI智能体在保持100%成功率的同时削减85%成本、91% token和92%检查文件,显著提升效率。


Release v5.14.0 80

  • Tags: 模型发布 开源生态 推理优化 框架更新

  • Source: GitHub Release - Hugging Face Transformers | 阅读原文

[摘要]
Hugging Face Transformers v5.14.0 发布,新增975B参数多模态模型 Inkling 和 TIPSv2,优化推理性能(SDPA prefill 最高提速260%),支持多Token预测解码等新特性。


GPT-Red: Unlocking Self-Improvement for Robustness 80

  • Tags: AI安全 模型对齐 OpenAI 自改进

  • Source: OpenAI News | 阅读原文

[摘要]
OpenAI发布GPT-Red,一种通过自对战进行自动化红队测试的系统,旨在提升AI安全、对齐和对抗提示注入的鲁棒性。


阿里Qwen将集成至Apple Intelligence服务中国用户 80

  • Tags: 大模型 产品发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
阿里Qwen模型将集成至Apple Intelligence,为中国iOS等用户提供AI功能,已获网信办备案。


Speculate with Memory: Lossless Acceleration for LLM Agents 80

  • Tags: 推理优化 智能体 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
为LLM智能体提出带记忆的推测执行,通过三种在线记忆系统提升准确率19-39%,加速推理且无损。


From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Models 80

  • Tags: AI安全 研究 大模型 评估框架

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
微软提出LLM提示-响应对偶安全分析框架,发现3%响应会升级风险,揭示帮助性与无害性的权衡。


Do LLMs Know What They Know? Measuring Metacognitive Efficiency with Signal Detection Theory 80

  • Tags: 大模型 研究发布 AI安全 模型评估

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
用信号检测理论分解LLM置信度与真实知识,发现元认知效率与准确率负相关,为模型评估提供新视角。


A Neurosymbolic Approach to Natural Language Formalization and Verification 80

  • Tags: 推理优化 AI安全 产品发布 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
介绍ARc服务,结合LLM与自动推理实现自然语言政策的逻辑形式化与验证,为金融、医疗等受监管行业提供可审计的正确性保证,是主流云服务商首次将自动推理集成到AI护栏中。


Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models 80

  • Tags: 智能体 训练方法 大模型 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出函数感知中间填充中间训练方法,提升编码智能体在SWE-Bench等基准性能,并缓解后训练导致的非智能体编码能力退化。


QDEvo: A Multi-Objective Quality-Diversity Framework for Automated Heuristic Design 80

  • Tags: 研究进展 大模型 进化计算 自动启发式设计

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出QDEvo框架,将大语言模型与进化计算结合,通过质量-多样性优化解决自动启发式设计中的模式坍塌问题,在基准测试和工业应用中超越现有方法。


国行 Apple 智能完成备案,阿里千问将集成至苹果 AI 能力 80

  • Tags: 公司动态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
苹果国行AI备案完成,阿里千问集成至Apple智能,为iOS、iPadOS等中国用户提供文本图像理解与内容生成能力。


The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context 80

  • Tags: 大模型 AI安全 模型评估 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究发现大模型在任务无关上下文中聚合准确率看似稳健,但单个样本预测常出现不可忽略的翻转,暴露了评估方法的隐藏风险,值得关注。


Policy-Conditioned Constrained Decoding for Column-Level Access Control in Text-to-SQL 80

  • Tags: AI安全 模型推理 数据隐私 自然语言处理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
PCC-SQL通过策略约束解码实现Text-to-SQL的确定性列级访问控制,零泄漏且高覆盖率,提升数据安全与合规性。


From Words to Widgets for Controllable LLM Generation 80

  • Tags: 智能体 大模型 产品发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Malleable Prompting,将自然语言偏好转化为GUI滑块/下拉等小部件,通过解码算法调控生成,用户研究表明比纯提示更精确可控。


LLM Judges Can Be Too Generous When There Is No Reference Answer 80

  • Tags: 大模型 模型评测 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究表明,LLM裁判在无参考答案时容易过度宽容,加入参考答案可改变高达85%的评判结果,强调了校准评估方法的必要性。