Skip to content

2026-07-05

NVIDIA联合密歇根大学等提出ASPIRE自改进机器人框架,在LIBERO-Pro等任务上零样本成功率最高提升77分,双手交接成功率从20%跃升至92%。 我国发布全球首款可控存内计算的忆阻器神经动力学芯片,采用40nm工艺,单步运算时延2.12毫秒,脑皮层重建任务较GPU提速50-478倍,突破神经动力学实时计算瓶颈,成果登上《科学》。 提出Goggle…

NVIDIA 联合多所大学提出 ASPIRE:自我改进机器人框架,零样本成功率最高提升 77 分 85

  • Tags: 机器人 AI研究 框架优化

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA联合密歇根大学等提出ASPIRE自改进机器人框架,在LIBERO-Pro等任务上零样本成功率最高提升77分,双手交接成功率从20%跃升至92%。


我国研制全球首款基于可控存内计算的忆阻器神经动力学芯片 85

  • Tags: 芯片算力 存内计算 硬件创新

  • Source: AI HOT 精选 | 阅读原文

[摘要]
我国发布全球首款可控存内计算的忆阻器神经动力学芯片,采用40nm工艺,单步运算时延2.12毫秒,脑皮层重建任务较GPU提速50-478倍,突破神经动力学实时计算瓶颈,成果登上《科学》。


Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing 80

  • Tags: 大模型 模型训练 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Goggles模块,通过梯度编辑给LLM注入认知框架,解决负向忽视问题:模型识别虚构内容准确率从9%提升至91%,且保持原有能力,为安全微调提供新路径。


StatEval: A Comprehensive Benchmark for Large Language Models in Statistics 80

  • Tags: 大模型 基准评测 推理能力

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
首个大规模统计推理基准StatEval发布,包含超10万道题,评估LLM在基础与研究级统计推理表现,发现研究级推理仍是短板。


Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model 80

  • Tags: 大模型 推理优化 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新框架PASE将云故障恢复视为神经符号程序合成,利用LLM生成恢复计划,结合神经符号世界模型验证与DRL优化,减少40%恢复时间,提升未知故障检测精度。


Program-as-Weights: A Programming Paradigm for Fuzzy Functions 80

  • Tags: 大模型 推理优化 编程范式

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Program-as-Weights范式,将模糊函数编译为轻量模型适配器,0.6B解释器匹配32B性能,推理内存减少50倍,实现本地高效离线执行。


Large language models reshape the language of science 80

  • Tags: 大模型 AI研究 AI安全 科学传播

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究发现LLM正改变科学写作:2024年起词汇更复杂但句子更简单,非英语母语学者应用更明显;可能扩大科学与公众的语言鸿沟但促进国际参与。


Kara: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression 80

  • Tags: 推理优化 LLM推理 模型压缩

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Kara提出滑动窗口KV缓存压缩方法,缓解长链思维解码中的内存瓶颈,设计Token2Chunk灵活保留语义信息,并开发基于vLLM的推理框架KvLLM,显著提升输出吞吐。


Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning 80

  • Tags: 多模态 推理 强化学习 视觉语言模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出VRRL强化学习框架,通过轨迹前缀遮蔽和经验回放缓冲,提升视觉语言模型在分布偏移下的视觉自反思能力,显著改善跨模态推理准确性。


Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning 80

  • Tags: 语音语言模型 训练方法 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出SpeechCombine方法,通过连续预训练与权重组合,无需指令微调即可让语音语言模型具备指令跟随能力,显著降低训练成本。


pscaling small models: Principled warm starts and hyperparameter transfer 80

  • Tags: 模型扩展 训练方法 大模型 AI研究

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出基于μP理论的模型扩展方法,实现从训练好的小模型初始化大模型并高效迁移超参数,可显著降低训练和调参成本。


  • Tags: 语音处理 大模型 指令跟随 研究突破

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
NAVER LABS Europe在IWSLT 2026指令跟随语音赛道中,通过SpeechMapper语音投影和合成SQA数据集fakACL,以更紧凑模型实现并列第一。


HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety 80

  • Tags: AI安全 模型发布 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
开源多语言AI安全分类器HaloGuard 1.0发布,以不到主流模型十分之一参数量实现SOTA性能,F1达90.9,防误报率4.3。


Hyperloop Transformers 78

  • Tags: 模型发布 AI研究 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Hyperloop Transformer 提出一种参数高效的 LLM 架构,通过循环 Transformer 与超连接,在保持性能的同时减少约 50% 参数,适用于内存受限的边缘部署。


ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models 78

  • Tags: 推理优化 大模型 高效推理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
ThreadWeaver框架通过两阶段并行轨迹、基于trie的部署和并行感知强化学习,实现大语言模型自适应并行推理,在数学基准上保持准确性的同时提升1.53倍速度,为高效推理开辟新方向。


MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark 78

  • Tags: 评测基准 多语言 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
MSQA是一个新基准,评估大模型在多语言环境下的文化知识对齐,发现模型存在文化退化且无法通过简单推理时方法解决,对多语言AI系统有重要启示。


OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets 78

  • Tags: AI安全 模型评测 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准OpenSafeIntent通过控制提示集评估模型在双用途场景下的意图校准安全完成,发现模型安全行为在意图变化时脆弱,提示安全评估需考虑意图校准。


Black-Box Inference of LLM Architectural Properties with Restrictive API Access 78

  • Tags: AI安全 模型安全 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出NightVision攻击,通过限制性API(仅单个logit和无logit偏置)推断LLM隐藏维度、深度和参数量,对AI安全与模型透明度有重要启示。


An Isotropic Approach to Efficient Uncertainty Quantification with Gradient Norms 75

  • Tags: 研究论文 不确定性量化 大模型 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出一种基于梯度范数的轻量级不确定性量化方法,仅需单次前向-后向传播即可估计语言模型的认知和偶然不确定性,无需训练数据,在大模型上验证有效。


Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning 75

  • Tags: RAG 强化学习 研究进展 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出RRPO框架,用强化学习将RAG重排序器与大模型生成质量对齐,无需人工标注,显著提升检索增强生成效果。