2026-07-05
NVIDIA联合密歇根大学等提出ASPIRE自改进机器人框架,在LIBERO-Pro等任务上零样本成功率最高提升77分,双手交接成功率从20%跃升至92%。 我国发布全球首款可控存内计算的忆阻器神经动力学芯片,采用40nm工艺,单步运算时延2.12毫秒,脑皮层重建任务较GPU提速50-478倍,突破神经动力学实时计算瓶颈,成果登上《科学》。 提出Goggle…
NVIDIA 联合多所大学提出 ASPIRE:自我改进机器人框架,零样本成功率最高提升 77 分 85
Tags:
机器人AI研究框架优化Source:
AI HOT 精选| 阅读原文
[摘要]
NVIDIA联合密歇根大学等提出ASPIRE自改进机器人框架,在LIBERO-Pro等任务上零样本成功率最高提升77分,双手交接成功率从20%跃升至92%。
我国研制全球首款基于可控存内计算的忆阻器神经动力学芯片 85
Tags:
芯片算力存内计算硬件创新Source:
AI HOT 精选| 阅读原文
[摘要]
我国发布全球首款可控存内计算的忆阻器神经动力学芯片,采用40nm工艺,单步运算时延2.12毫秒,脑皮层重建任务较GPU提速50-478倍,突破神经动力学实时计算瓶颈,成果登上《科学》。
Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing 80
Tags:
大模型模型训练AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Goggles模块,通过梯度编辑给LLM注入认知框架,解决负向忽视问题:模型识别虚构内容准确率从9%提升至91%,且保持原有能力,为安全微调提供新路径。
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics 80
Tags:
大模型基准评测推理能力Source:
arXiv Computation and Language| 阅读原文
[摘要]
首个大规模统计推理基准StatEval发布,包含超10万道题,评估LLM在基础与研究级统计推理表现,发现研究级推理仍是短板。
Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model 80
Tags:
大模型推理优化智能体Source:
arXiv Computation and Language| 阅读原文
[摘要]
新框架PASE将云故障恢复视为神经符号程序合成,利用LLM生成恢复计划,结合神经符号世界模型验证与DRL优化,减少40%恢复时间,提升未知故障检测精度。
Program-as-Weights: A Programming Paradigm for Fuzzy Functions 80
Tags:
大模型推理优化编程范式Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Program-as-Weights范式,将模糊函数编译为轻量模型适配器,0.6B解释器匹配32B性能,推理内存减少50倍,实现本地高效离线执行。
Large language models reshape the language of science 80
Tags:
大模型AI研究AI安全科学传播Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究发现LLM正改变科学写作:2024年起词汇更复杂但句子更简单,非英语母语学者应用更明显;可能扩大科学与公众的语言鸿沟但促进国际参与。
Kara: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression 80
Tags:
推理优化LLM推理模型压缩Source:
arXiv Computation and Language| 阅读原文
[摘要]
Kara提出滑动窗口KV缓存压缩方法,缓解长链思维解码中的内存瓶颈,设计Token2Chunk灵活保留语义信息,并开发基于vLLM的推理框架KvLLM,显著提升输出吞吐。
Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning 80
Tags:
多模态推理强化学习视觉语言模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出VRRL强化学习框架,通过轨迹前缀遮蔽和经验回放缓冲,提升视觉语言模型在分布偏移下的视觉自反思能力,显著改善跨模态推理准确性。
Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning 80
Tags:
语音语言模型训练方法模型发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出SpeechCombine方法,通过连续预训练与权重组合,无需指令微调即可让语音语言模型具备指令跟随能力,显著降低训练成本。
pscaling small models: Principled warm starts and hyperparameter transfer 80
Tags:
模型扩展训练方法大模型AI研究Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
提出基于μP理论的模型扩展方法,实现从训练好的小模型初始化大模型并高效迁移超参数,可显著降低训练和调参成本。
NAVER LABS Europe Submission to the Instruction-following 2026 Short Track 80
Tags:
语音处理大模型指令跟随研究突破Source:
arXiv Computation and Language| 阅读原文
[摘要]
NAVER LABS Europe在IWSLT 2026指令跟随语音赛道中,通过SpeechMapper语音投影和合成SQA数据集fakACL,以更紧凑模型实现并列第一。
HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety 80
Tags:
AI安全模型发布开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
开源多语言AI安全分类器HaloGuard 1.0发布,以不到主流模型十分之一参数量实现SOTA性能,F1达90.9,防误报率4.3。
Hyperloop Transformers 78
Tags:
模型发布AI研究推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
Hyperloop Transformer 提出一种参数高效的 LLM 架构,通过循环 Transformer 与超连接,在保持性能的同时减少约 50% 参数,适用于内存受限的边缘部署。
ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models 78
Tags:
推理优化大模型高效推理Source:
arXiv Computation and Language| 阅读原文
[摘要]
ThreadWeaver框架通过两阶段并行轨迹、基于trie的部署和并行感知强化学习,实现大语言模型自适应并行推理,在数学基准上保持准确性的同时提升1.53倍速度,为高效推理开辟新方向。
MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark 78
Tags:
评测基准多语言大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
MSQA是一个新基准,评估大模型在多语言环境下的文化知识对齐,发现模型存在文化退化且无法通过简单推理时方法解决,对多语言AI系统有重要启示。
OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets 78
Tags:
AI安全模型评测研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准OpenSafeIntent通过控制提示集评估模型在双用途场景下的意图校准安全完成,发现模型安全行为在意图变化时脆弱,提示安全评估需考虑意图校准。
Black-Box Inference of LLM Architectural Properties with Restrictive API Access 78
Tags:
AI安全模型安全研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出NightVision攻击,通过限制性API(仅单个logit和无logit偏置)推断LLM隐藏维度、深度和参数量,对AI安全与模型透明度有重要启示。
An Isotropic Approach to Efficient Uncertainty Quantification with Gradient Norms 75
Tags:
研究论文不确定性量化大模型推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出一种基于梯度范数的轻量级不确定性量化方法,仅需单次前向-后向传播即可估计语言模型的认知和偶然不确定性,无需训练数据,在大模型上验证有效。
Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning 75
Tags:
RAG强化学习研究进展推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出RRPO框架,用强化学习将RAG重排序器与大模型生成质量对齐,无需人工标注,显著提升检索增强生成效果。