Skip to content

2026-07-31

Google DeepMind推出Gemini Robotics 2,赋能仿人机器人全身智能、灵巧操作与多机协作,推动物理AI发展。 提出MeRLa元学习奖励塑形框架,通过任务感知的复合奖励提升RLHF对齐质量及训练稳定性,在LLaMA-3-8B上获得90.8%胜率和9.14高分,训练不稳定降低41%。 OpenAI通过启用保留推理过程和压缩两项API设置,…

Google DeepMind 发布 Gemini Robotics 2 物理 AI 90

  • Tags: Google DeepMind 机器人 物理AI 模型发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google DeepMind推出Gemini Robotics 2,赋能仿人机器人全身智能、灵巧操作与多机协作,推动物理AI发展。


Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback 87

  • Tags: RLHF 对齐 奖励塑形 模型训练

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出MeRLa元学习奖励塑形框架,通过任务感知的复合奖励提升RLHF对齐质量及训练稳定性,在LLaMA-3-8B上获得90.8%胜率和9.14高分,训练不稳定降低41%。


启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍 85

  • Tags: 大模型 推理优化 基准测试 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI通过启用保留推理过程和压缩两项API设置,使GPT-5.6在ARC-AGI-3基准测试得分提升三倍,同时提高效率。


GPT-Red: Automated Red Teaming via Self-Play at Scale 85

  • Tags: AI安全 红队测试 自对弈 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
OpenAI提出GPT-Red自动化红队系统,通过大规模自对弈训练发现提示注入攻击,并用对抗训练提升GPT-5.6鲁棒性,攻击能力超越人类红队。


Steering Instruction Hierarchies at Inference Time 85

  • Tags: 推理优化 AI安全 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
V-Steer 提出无需训练的推理时方法,通过编辑缓存价值向量实现指令层级优先,将大模型主约束准确率从18%提升至92%,显著提升安全性。


How enabling two settings tripled our scores on the ARC-AGI-3 benchmark 85

  • Tags: 大模型 模型评测 推理优化

  • Source: OpenAI News | 阅读原文

[摘要]
通过两个API设置(保留推理和启用压缩),GPT-5.6在ARC-AGI-3基准测试中得分提升三倍,推理链保留与输出压缩联合优化带来显著性能突破。


Ratchet: A Minimal Hygiene Recipe for Self-Evolving LLM Agents 85

  • Tags: 智能体 模型研究 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Ratchet方法,让冻结LLM智能体通过自我管理技能库自我进化,无需权重更新,在编程任务上性能大幅提升,为智能体技能生命周期管理提供简洁有效方案。


SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning 82

  • Tags: 推理优化 强化学习 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
SERPO提出自进化策略优化方法,使语言模型在推理时无需外部反馈即可自我改进,在多个基准上大幅提升性能。


LLMAR: A Tuning-Free Recommendation Framework for Sparse and Text-Rich Industrial Domains 82

  • Tags: 推荐系统 LLM 推理优化 工业应用

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出无需微调的LLM推荐框架LLMAR,利用推理注释与反射循环解决稀疏工业数据推荐问题,在工业数据集上nDCG@10提升54.6%,成本低。


GPT-5.6 如何推进性价比前沿 80

  • Tags: 模型发布 产品发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI 推出 GPT-5.6 Luna 和 Terra 版本,降低定价以提高性价比,助力企业大规模部署 AI 工作流。


Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration 80

  • Tags: 模型发布 机器人 多模态 视频理解

  • Source: Google DeepMind Blog | 阅读原文

[摘要]
Google DeepMind推出Gemini Robotics ER 2,实现视频理解、任务编排和多机器人协作,推动机器人智能体在真实世界中的推理与协作能力。


Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人 80

  • Tags: 模型发布 机器人 多模态 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google DeepMind发布Gemini Robotics ER 2,基于Gemini的机器人基础模型,在视频理解、任务编排与多机器人协作上实现阶跃式提升,推动机器人推理与真实世界任务解决。


PIKS: Universal Physics-Informed Kernel Methods 80

  • Tags: AI for Science 理论进展 核方法

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
PIKS 提出了一种将物理原理融入核方法的新框架,证明了通用一致性,为物理信息机器学习提供了理论基础,对比PINNs有更好的可解释性。


From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon 80

  • Tags: 推理优化 开源生态 芯片算力 框架发布

  • Source: Berkeley AI Research Blog | 阅读原文

[摘要]
K-Search框架将CUDA内核优化经验自动迁移至Apple Silicon的MLX框架,实现Attention内核0.97x加速与Mamba SSM内核20倍prefill加速,弥合了NVIDIA与Apple生态的性能差距。


腾讯混元Hyra破解50年数学难题 80

  • Tags: 智能体 AI for Science 大模型 数学研究

  • Source: AI HOT 精选 | 阅读原文

[摘要]
腾讯混元研究智能体Hyra与Hy3模型破解了自1969年以来的数学极值难题,首次构造出整数集使|A+A|与|A-A|的指数比精确达到2,证明最优指数为2,展示了AI在数学研究中的突破性应用。


Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents 80

  • Tags: 智能体 推理优化 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出SkillTTA方法,通过检索任务相关轨迹并合成临时技能,提升LLM智能体测试时计算利用率,在多个基准上超越现有方法且成本更低。


TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning 80

  • Tags: 智能体 基准测试 评测 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
TREK是面向复杂旅行规划的LLM智能体基准测试,包含800个多约束任务和确定性评估器,测试发现最强模型仅46%可行,揭示智能体执行力的普遍瓶颈。


Living-Harness Is an Interactive-Agent Evolver 80

  • Tags: 智能体 研究进展 交互系统

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Living-Harness 提出一种自演化智能体框架,通过持续更新交互策略与执行知识,在多个交互环境中显著提升大模型智能体成功率。


Hearsay: Vision-Language Medical Diagnoses Without an Image 80

  • Tags: AI安全 模型研究 大模型 医疗AI

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究显示Claude、GPT-5.4、Gemini等前沿视觉语言模型在无图像输入时,仅凭患者人口统计信息就编造诊断,且偏差具有系统性,需直接审计结构化输出通道以确保临床部署安全。


FedWeave: Rethinking the Unit of Specialization in Heterogeneous Federated MoE-LoRA 80

  • Tags: 联邦学习 大模型 模型微调 MoE

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
FedWeave提出非对称聚合框架,分离专家和路由器优化,解决异构联邦MoE-LoRA中任务干扰问题,提升大模型微调效果。