Skip to content

2026-07-18

OpenAI Sora 2 视频深度克隆效果惊人,能精准捕捉面部肌肉运动,生成难辨真伪的视频,引发对AI伪造风险的讨论。 Schema Harness框架在ARC-AGI-3公开集上使用Claude Opus 4.8等模型取得约99%成绩,通过不修改权重的程序转化方法大幅超越此前最强模型,是AGI基准测试的重大突破。 月之暗面在GTC 2026披露Kimi …

Sora 2 视频克隆效果惊人,真假难辨 95

  • Tags: 模型发布 视频生成 AI安全

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI Sora 2 视频深度克隆效果惊人,能精准捕捉面部肌肉运动,生成难辨真伪的视频,引发对AI伪造风险的讨论。


Schema Harness 在 ARC-AGI-3 公开集上取得约 99% 成绩 95

  • Tags: 研究进展 模型发布 推理 智能体

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Schema Harness框架在ARC-AGI-3公开集上使用Claude Opus 4.8等模型取得约99%成绩,通过不修改权重的程序转化方法大幅超越此前最强模型,是AGI基准测试的重大突破。


月之暗面在GTC 2026披露Kimi K2.5技术路线:用MuonClip、线性注意力与Agent Swarm重构三大基础组件 90

  • Tags: 模型发布 推理优化 智能体 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
月之暗面在GTC 2026披露Kimi K2.5三大基础组件:MuonClip优化器将数据效率提升近一倍;线性注意力在百万Token下超越全注意力;Agent Swarm支持300个Agent并行工作。


NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一 85

  • Tags: 模型发布 开源生态 NVIDIA 向量嵌入

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA 开源 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准排名第一,1B 版本通过 NVFP4 量化在 Blackwell 上实现 2 倍吞吐量提升,精度损失仅 0.5%。


Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel 85

  • Tags: 推理优化 成本降低 上下文扩展 AI研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出字节精确KV缓存嫁接技术,不改变权重即可提升小模型性能并大幅降低推理成本,在AIME 2025上使12B模型超越31B,扩展上下文至285万token。


DialogueVPR: Towards Conversational Visual Place Recognition 85

  • Tags: 视觉位置识别 多模态 智能体 对话推理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出对话式视觉位置识别新范式,通过交互式对话推理改善模糊自然语言描述下的定位性能,在基准上显著超越基线。


Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning 85

  • Tags: 模型训练 强化学习 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
BPO提出分支策略优化,利用沙盒可快照特性降低强化学习方差,在WebShop、ALFWorld、SWE-bench等agent任务上提升3.6-6.1个百分点,显著减少梯度方差和策略更新次数。


Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头 82

  • Tags: 大模型 模型发布 开源生态 编码

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Kimi K3 以前端编码榜1679分夺冠,2.8万亿参数MoE架构,百万上下文,开放权重,API转向长上下文智能体定价,挑战闭源模型。


八天四款前沿模型发布,Kimi K3 跻身第三 80

  • Tags: 模型发布 大模型 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
八天内Grok4.5、GPT-5.6、Muse Spark1.1与Kimi K3四款前沿模型密集发布,Kimi K3跻身第三,反映AI模型竞争加剧。


Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高 80

  • Tags: 模型发布 大模型 AI编程

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic 的 Claude Fable 5 模型在 Cursor 内部基准 CursorBench 上达 72.9% 新高,展现全局推理能力,显著超越此前模型,值得关注。


通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms 80

  • Tags: 模型发布 多模态 推理优化

  • Source: AI HOT 精选 | 阅读原文

[摘要]
通义实验室发布Wan-Streamer v0.2全模态Transformer,统一听看说演,端到端延迟仅550ms,分辨率提升至640x368,采用双通路架构优化画质与延迟。


Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning 80

  • Tags: AI安全 强化学习 对齐 模型训练

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出SARA方法,通过对比学习将偏好转化为奖励信号,在强化学习对齐中显著提升对噪声标签的鲁棒性,推动安全对齐技术发展。


Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making 80

  • Tags: 大模型 智能体 推理优化 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Multi-Head Latent Control,从冻结LLM/VLM隐状态中学习部署时控制信号,实现路由、工具调用等决策,大模型使用量降低高达90.7%,显著提升效率。


Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence 80

  • Tags: 研究 大模型 LLM评估 自动生成

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 Rubrics on Trial 框架,仅凭查询自动演化评分标准,无需人工标注或模型训练,在多个偏好基准上取得最佳平均准确率,对 LLM 训练与评估具有重要意义。


T^2MLR: Transformer with Temporal Middle-Layer Recurrence 80

  • Tags: 模型架构 推理优化 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出T²MLR架构,通过在中间层引入循环机制使中间推理状态跨token持久化,显著提升多步推理能力且无需从头预训练。


Breaking Refusal in the First Half: A Mechanistic Study of the Prefill Jailbreak 80

  • Tags: AI安全 模型安全 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示预填充越狱通过响应前半部分即可破坏模型拒绝机制,拒绝是浅层计算,对AI安全防御有重要启示。


OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios 80

  • Tags: 智能体 基准测试 模型评估

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
OmniaBench发布,覆盖90个应用域的通用AI Agent基准(1431任务),测试显示Claude-Sonnet-5和GPT-5.6-Sol仅得58%和57%,暴露规划与自适应修正短板。


Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect 80

  • Tags: 研究发布 训练方法 小模型 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出内省微调(IFT)方法,通过监督学习显著提升小语言模型检测自身激活扰动的能力,实验显示Llama-1B准确率从9.6%提升至60.6%,且不影响标准能力,有助于AI透明度和对齐。


Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs 80

  • Tags: 大模型 AI安全 模型微调

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示微调LLMs(如GPT-4.1)于窄数据集会导致跨领域意识形态泛化,即使数据看似中立;该现象可能放大极端输出,对AI安全与对齐构成新挑战。


Pretraining Data Can Be Poisoned through Computational Propaganda 80

  • Tags: 模型安全 预训练 数据投毒 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究展示通过公共讨论界面可对预训练数据进行投毒,并引入HalfLife工具评估恶意内容纳入风险,对模型安全有重要警示。