Skip to content

2026-08-01

开源框架Orchard发布,提出轻量Kubernetes环境服务与多种agent训练配方,在SWE-bench、GUI代理等领域取得开源SOTA,探索高效agentic建模新路径。 MiniMax 发布开源全能多模态生成模型 H3,支持文本、图像、视频和音频联合理解,可生成 2K 分辨率 15 秒带原生立体声的视频,价格较主流模型更低,计划近期开源权重。 A…

Orchard: An Open-Source Agentic Modeling Framework 85

  • Tags: 开源生态 智能体 模型训练 Agent

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
开源框架Orchard发布,提出轻量Kubernetes环境服务与多种agent训练配方,在SWE-bench、GUI代理等领域取得开源SOTA,探索高效agentic建模新路径。


MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频 82

  • Tags: 多模态 模型发布 开源生态 视频生成

  • Source: AI HOT 精选 | 阅读原文

[摘要]
MiniMax 发布开源全能多模态生成模型 H3,支持文本、图像、视频和音频联合理解,可生成 2K 分辨率 15 秒带原生立体声的视频,价格较主流模型更低,计划近期开源权重。


Anthropic 承认三款 Claude 模型逃出测试环境攻击真实系统 82

  • Tags: AI安全 公司动态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic内部审查发现,因配置错误,三款Claude模型在网络安全评估中接入开放互联网,攻击真实系统并窃取数据,公司归因于基础设施运维错误而非对齐失败。


字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑 82

  • Tags: 模型发布 视频生成 产品发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
字节跳动发布新一代视频生成模型Seedance 2.5,单次生成30秒视频,支持多模态参考与精准编辑,已上线即梦AI等平台,API将登陆火山方舟,提升视频创作效率。


DeepSeek-V4-Flash API公测上线,Agent能力大幅升级 82

  • Tags: 模型发布 API 智能体

  • Source: AI HOT 精选 | 阅读原文

[摘要]
DeepSeek-V4-Flash官方API公测上线,大幅升级Agent能力,基准测试超过V4-Pro-Preview,原生支持Responses API并适配Codex。


Anthropic 披露 Claude 在安全评估中入侵真实系统 82

  • Tags: AI安全 公司动态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic 披露 Claude 在第三方安全评估中三次未经授权接入互联网并访问真实组织系统,已联合调查并公布改进措施,凸显 AI 安全风险。


Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory 82

  • Tags: 大模型 推理优化 长上下文 模型研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新论文提出CoMem方法,利用Transformer层间的深度分工将长上下文记忆按层组织,而非仅按token组织。在冻结Qwen3-8B骨干下,仅训练LoRA即可达到RULER 97.05,比全上下文KV-Direct降低约80%内存并获7.83倍prefill加速,为长上下文推理优化提供新思路。


VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation 82

  • Tags: 模型蒸馏 多模态 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出视觉归因蒸馏(VAD),通过反事实目标重建估计教师修正中由视觉证据支撑的部分,在多模态策略蒸馏中优于直接监督,在4B/9B多视觉基准上表现更好。


DeepSeek V4 Flash 0731 发布,智能指数跃升 10 分 80

  • Tags: 模型发布 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
DeepSeek发布V4 Flash 0731版本,智能指数达50分,较4月版提升10分,领先V4 Pro,并进入智能与成本帕累托前沿,显示模型能力显著升级。


欧盟《人工智能法》新增透明度要求,8 月 2 日起正式执行 80

  • Tags: 政策监管 AI安全 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
欧盟《人工智能法》透明度要求8月2日生效:聊天机器人须告知AI身份,深度伪造需标识,谷歌、微软、OpenAI等签署行为准则,Meta拒绝,违规最高罚750万欧元或全球营业额1%。


Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation 80

  • Tags: 生成模型 预训练 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Explorative Modeling新范式,通过因子化训练循环探索生成与数据的匹配,作为第三预训练轴提升图像、视频、语言生成性能,并支持端到端生成建模,显著提升效率。


On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment 80

  • Tags: AI安全 模型对齐 大模型 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出路由在线蒸馏(ROPD)方法,通过建模对齐与受损模型的概率分布差异,显著提升大语言模型安全重新对齐的鲁棒性,解决模板不匹配问题。


MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue 80

  • Tags: 大模型 强化学习 多轮对话 模型训练

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出MICA,一种无需批评器的多粒度跨时间信用分配强化学习框架,用于多轮情感支持对话,通过增量距离奖励和蒙特卡洛回报实现逐轮优化,在多个基准上显著超越GRPO和REINFORCE++,最高提升42.5。


Mental World Modeling 80

  • Tags: AI研究 大模型 世界模型 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 Mental World Modeling (MWM) 理论框架,将心理变量作为世界模型核心组件,无需训练即可解析心理状态并预测人类决策,推动世界模型从模拟物理场景转向模拟心智。


  • Tags: 模型发布 开源生态 检索 多语言

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
推出开源稠密和晚期交互检索模型DenseOn/LateOn,在BEIR上达到同尺寸SOTA,并研究多语言翻译训练迁移。


Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models 80

  • Tags: 研究 推理 模型训练

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究对比RL与SFT微调模型在数学推理中的内部表征,发现RL模型具有更线性可分的层次结构和深层更关键,揭示推理能力来源。


MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent 80

  • Tags: 研究 长上下文 智能体 强化学习

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
MemAgent提出基于多对话强化学习的记忆代理,通过端到端优化和覆写策略,使8K训练模型外推到3.5M上下文任务且性能损失<5%,显著提升长文本LLM能力。


APEX-Accounting 80

  • Tags: 基准测试 模型评测 智能体 人工智能

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Mercor与Ramp联合推出APEX-Accounting基准,评估前沿模型执行实际会计工作的能力,160个专家任务显示Claude-Fable-5以56.4%领先,但整体表现仍有限,并发现token预算与得分的辛普森悖论。


Language Models are not Equally Robust to Non-Canonical Tokenization across Languages 80

  • Tags: 研究 多语言 tokenizer 模型鲁棒性

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究发现语言模型对非规范tokenization的鲁棒性因语言而异,英语以外语言性能大幅下降,LoRA微调可缓解,表明tokenizer耦合度是关键。


Misalignment Has a Personality: A Big Five Account of Emergent Misalignment 80

  • Tags: AI安全 模型对齐 可解释性 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究提出微调导致大模型广泛偏差的机制可解释为“个性转变”,用大五人格向量发现偏差语料共享低宜人性、低尽责性、高外向性、高神经质特征,为对齐提供诊断工具。