2026-07-16
提出Ring-Zero方法,将零强化学习扩展到万亿参数模型,通过稳定训练管线提升数学推理性能,并观察到拟人化、自验证等涌现能力,为大规模RL提供新见解。 提出Knowledgeless语言模型(KLLMs),通过匿名化实体削弱参数记忆,使模型更依赖上下文证据,在检索增强任务中相对提升20-25%,减少幻觉并改善校准。 阿里通义实验室发布实时语音交互模型Qwe…
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning 95
Tags:
大模型研究突破强化学习推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Ring-Zero方法,将零强化学习扩展到万亿参数模型,通过稳定训练管线提升数学推理性能,并观察到拟人化、自验证等涌现能力,为大规模RL提供新见解。
Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling 85
Tags:
研究大模型训练方法推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Knowledgeless语言模型(KLLMs),通过匿名化实体削弱参数记忆,使模型更依赖上下文证据,在检索增强任务中相对提升20-25%,减少幻觉并改善校准。
阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一 85
Tags:
模型发布语音交互阿里实时模型Source:
AI HOT 精选| 阅读原文
[摘要]
阿里通义实验室发布实时语音交互模型Qwen-Audio-3.0-Realtime,在语音推理评测中超越OpenAI GPT-Realtime-2排名第一,标志着国产语音模型取得重要突破。
Cursor IDE 0day 漏洞:打开恶意仓库即可自动执行任意代码 85
Tags:
AI安全产品发布Source:
AI HOT 精选| 阅读原文
[摘要]
Cursor IDE存在严重0day漏洞,打开恶意仓库即可自动执行任意代码,影响大量开发者,需及时缓解。
Triton Plugin Extensions: Enabling TLX and Custom Compiler Passes Out of the Box 82
Tags:
推理优化开源生态PyTorch芯片算力Source:
PyTorch Blog| 阅读原文
[摘要]
PyTorch-Triton 3.7 发布 Triton Plugin Extensions 系统,支持动态加载自定义编译器 pass 与 DSL 扩展,大幅提升 GPU 算子开发的灵活性与生态兼容性。
Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution 82
Tags:
智能体推理优化模型评测Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出任务感知执行估计方法E3,使AI智能体在保持100%成功率的同时削减85%成本、91% token和92%检查文件,显著提升效率。
Release v5.14.0 80
Tags:
模型发布开源生态推理优化框架更新Source:
GitHub Release - Hugging Face Transformers| 阅读原文
[摘要]
Hugging Face Transformers v5.14.0 发布,新增975B参数多模态模型 Inkling 和 TIPSv2,优化推理性能(SDPA prefill 最高提速260%),支持多Token预测解码等新特性。
GPT-Red: Unlocking Self-Improvement for Robustness 80
Tags:
AI安全模型对齐OpenAI自改进Source:
OpenAI News| 阅读原文
[摘要]
OpenAI发布GPT-Red,一种通过自对战进行自动化红队测试的系统,旨在提升AI安全、对齐和对抗提示注入的鲁棒性。
阿里Qwen将集成至Apple Intelligence服务中国用户 80
Tags:
大模型产品发布公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
阿里Qwen模型将集成至Apple Intelligence,为中国iOS等用户提供AI功能,已获网信办备案。
Speculate with Memory: Lossless Acceleration for LLM Agents 80
Tags:
推理优化智能体大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
为LLM智能体提出带记忆的推测执行,通过三种在线记忆系统提升准确率19-39%,加速推理且无损。
From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Models 80
Tags:
AI安全研究大模型评估框架Source:
arXiv Computation and Language| 阅读原文
[摘要]
微软提出LLM提示-响应对偶安全分析框架,发现3%响应会升级风险,揭示帮助性与无害性的权衡。
Do LLMs Know What They Know? Measuring Metacognitive Efficiency with Signal Detection Theory 80
Tags:
大模型研究发布AI安全模型评估Source:
arXiv Computation and Language| 阅读原文
[摘要]
用信号检测理论分解LLM置信度与真实知识,发现元认知效率与准确率负相关,为模型评估提供新视角。
A Neurosymbolic Approach to Natural Language Formalization and Verification 80
Tags:
推理优化AI安全产品发布大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
介绍ARc服务,结合LLM与自动推理实现自然语言政策的逻辑形式化与验证,为金融、医疗等受监管行业提供可审计的正确性保证,是主流云服务商首次将自动推理集成到AI护栏中。
Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models 80
Tags:
智能体训练方法大模型模型发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出函数感知中间填充中间训练方法,提升编码智能体在SWE-Bench等基准性能,并缓解后训练导致的非智能体编码能力退化。
QDEvo: A Multi-Objective Quality-Diversity Framework for Automated Heuristic Design 80
Tags:
研究进展大模型进化计算自动启发式设计Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出QDEvo框架,将大语言模型与进化计算结合,通过质量-多样性优化解决自动启发式设计中的模式坍塌问题,在基准测试和工业应用中超越现有方法。
国行 Apple 智能完成备案,阿里千问将集成至苹果 AI 能力 80
Tags:
公司动态大模型Source:
AI HOT 精选| 阅读原文
[摘要]
苹果国行AI备案完成,阿里千问集成至Apple智能,为iOS、iPadOS等中国用户提供文本图像理解与内容生成能力。
The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context 80
Tags:
大模型AI安全模型评估研究发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究发现大模型在任务无关上下文中聚合准确率看似稳健,但单个样本预测常出现不可忽略的翻转,暴露了评估方法的隐藏风险,值得关注。
Policy-Conditioned Constrained Decoding for Column-Level Access Control in Text-to-SQL 80
Tags:
AI安全模型推理数据隐私自然语言处理Source:
arXiv Computation and Language| 阅读原文
[摘要]
PCC-SQL通过策略约束解码实现Text-to-SQL的确定性列级访问控制,零泄漏且高覆盖率,提升数据安全与合规性。
From Words to Widgets for Controllable LLM Generation 80
Tags:
智能体大模型产品发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Malleable Prompting,将自然语言偏好转化为GUI滑块/下拉等小部件,通过解码算法调控生成,用户研究表明比纯提示更精确可控。
LLM Judges Can Be Too Generous When There Is No Reference Answer 80
Tags:
大模型模型评测AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究表明,LLM裁判在无参考答案时容易过度宽容,加入参考答案可改变高达85%的评判结果,强调了校准评估方法的必要性。