2026-07-31
Google DeepMind推出Gemini Robotics 2,赋能仿人机器人全身智能、灵巧操作与多机协作,推动物理AI发展。 提出MeRLa元学习奖励塑形框架,通过任务感知的复合奖励提升RLHF对齐质量及训练稳定性,在LLaMA-3-8B上获得90.8%胜率和9.14高分,训练不稳定降低41%。 OpenAI通过启用保留推理过程和压缩两项API设置,…
Google DeepMind 发布 Gemini Robotics 2 物理 AI 90
Tags:
Google DeepMind机器人物理AI模型发布Source:
AI HOT 精选| 阅读原文
[摘要]
Google DeepMind推出Gemini Robotics 2,赋能仿人机器人全身智能、灵巧操作与多机协作,推动物理AI发展。
Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback 87
Tags:
RLHF对齐奖励塑形模型训练Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出MeRLa元学习奖励塑形框架,通过任务感知的复合奖励提升RLHF对齐质量及训练稳定性,在LLaMA-3-8B上获得90.8%胜率和9.14高分,训练不稳定降低41%。
启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍 85
Tags:
大模型推理优化基准测试公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI通过启用保留推理过程和压缩两项API设置,使GPT-5.6在ARC-AGI-3基准测试得分提升三倍,同时提高效率。
GPT-Red: Automated Red Teaming via Self-Play at Scale 85
Tags:
AI安全红队测试自对弈模型发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
OpenAI提出GPT-Red自动化红队系统,通过大规模自对弈训练发现提示注入攻击,并用对抗训练提升GPT-5.6鲁棒性,攻击能力超越人类红队。
Steering Instruction Hierarchies at Inference Time 85
Tags:
推理优化AI安全研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
V-Steer 提出无需训练的推理时方法,通过编辑缓存价值向量实现指令层级优先,将大模型主约束准确率从18%提升至92%,显著提升安全性。
How enabling two settings tripled our scores on the ARC-AGI-3 benchmark 85
Tags:
大模型模型评测推理优化Source:
OpenAI News| 阅读原文
[摘要]
通过两个API设置(保留推理和启用压缩),GPT-5.6在ARC-AGI-3基准测试中得分提升三倍,推理链保留与输出压缩联合优化带来显著性能突破。
Ratchet: A Minimal Hygiene Recipe for Self-Evolving LLM Agents 85
Tags:
智能体模型研究推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Ratchet方法,让冻结LLM智能体通过自我管理技能库自我进化,无需权重更新,在编程任务上性能大幅提升,为智能体技能生命周期管理提供简洁有效方案。
SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning 82
Tags:
推理优化强化学习大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
SERPO提出自进化策略优化方法,使语言模型在推理时无需外部反馈即可自我改进,在多个基准上大幅提升性能。
LLMAR: A Tuning-Free Recommendation Framework for Sparse and Text-Rich Industrial Domains 82
Tags:
推荐系统LLM推理优化工业应用Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出无需微调的LLM推荐框架LLMAR,利用推理注释与反射循环解决稀疏工业数据推荐问题,在工业数据集上nDCG@10提升54.6%,成本低。
GPT-5.6 如何推进性价比前沿 80
Tags:
模型发布产品发布公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI 推出 GPT-5.6 Luna 和 Terra 版本,降低定价以提高性价比,助力企业大规模部署 AI 工作流。
Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration 80
Tags:
模型发布机器人多模态视频理解Source:
Google DeepMind Blog| 阅读原文
[摘要]
Google DeepMind推出Gemini Robotics ER 2,实现视频理解、任务编排和多机器人协作,推动机器人智能体在真实世界中的推理与协作能力。
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人 80
Tags:
模型发布机器人多模态公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
Google DeepMind发布Gemini Robotics ER 2,基于Gemini的机器人基础模型,在视频理解、任务编排与多机器人协作上实现阶跃式提升,推动机器人推理与真实世界任务解决。
PIKS: Universal Physics-Informed Kernel Methods 80
Tags:
AI for Science理论进展核方法Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
PIKS 提出了一种将物理原理融入核方法的新框架,证明了通用一致性,为物理信息机器学习提供了理论基础,对比PINNs有更好的可解释性。
From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon 80
Tags:
推理优化开源生态芯片算力框架发布Source:
Berkeley AI Research Blog| 阅读原文
[摘要]
K-Search框架将CUDA内核优化经验自动迁移至Apple Silicon的MLX框架,实现Attention内核0.97x加速与Mamba SSM内核20倍prefill加速,弥合了NVIDIA与Apple生态的性能差距。
腾讯混元Hyra破解50年数学难题 80
Tags:
智能体AI for Science大模型数学研究Source:
AI HOT 精选| 阅读原文
[摘要]
腾讯混元研究智能体Hyra与Hy3模型破解了自1969年以来的数学极值难题,首次构造出整数集使|A+A|与|A-A|的指数比精确达到2,证明最优指数为2,展示了AI在数学研究中的突破性应用。
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents 80
Tags:
智能体推理优化研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出SkillTTA方法,通过检索任务相关轨迹并合成临时技能,提升LLM智能体测试时计算利用率,在多个基准上超越现有方法且成本更低。
TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning 80
Tags:
智能体基准测试评测大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
TREK是面向复杂旅行规划的LLM智能体基准测试,包含800个多约束任务和确定性评估器,测试发现最强模型仅46%可行,揭示智能体执行力的普遍瓶颈。
Living-Harness Is an Interactive-Agent Evolver 80
Tags:
智能体研究进展交互系统Source:
arXiv Computation and Language| 阅读原文
[摘要]
Living-Harness 提出一种自演化智能体框架,通过持续更新交互策略与执行知识,在多个交互环境中显著提升大模型智能体成功率。
Hearsay: Vision-Language Medical Diagnoses Without an Image 80
Tags:
AI安全模型研究大模型医疗AISource:
arXiv Computation and Language| 阅读原文
[摘要]
研究显示Claude、GPT-5.4、Gemini等前沿视觉语言模型在无图像输入时,仅凭患者人口统计信息就编造诊断,且偏差具有系统性,需直接审计结构化输出通道以确保临床部署安全。
FedWeave: Rethinking the Unit of Specialization in Heterogeneous Federated MoE-LoRA 80
Tags:
联邦学习大模型模型微调MoESource:
arXiv Computation and Language| 阅读原文
[摘要]
FedWeave提出非对称聚合框架,分离专家和路由器优化,解决异构联邦MoE-LoRA中任务干扰问题,提升大模型微调效果。