Skip to content

2026-08-08

斯坦福与Arc Institute用AI模型Evo从零设计完整病毒基因组,实验室构建出16种功能性病毒可杀死细菌,研究登Science,展示AI在生物设计领域的突破潜力。 腾讯混元开源HPC-Ops算子库并集成至SGLang主分支,Dynamic Attention与Fused MoE在Hy3模型上TPOT最高降48.8%,显著提升推理效率。 新研究提出TS…

斯坦福与 Arc Institute 用 AI 设计全新病毒基因组,16 种在实验室成功杀死细菌 85

  • Tags: AI研究 生物科技 模型应用

  • Source: AI HOT 精选 | 阅读原文

[摘要]
斯坦福与Arc Institute用AI模型Evo从零设计完整病毒基因组,实验室构建出16种功能性病毒可杀死细菌,研究登Science,展示AI在生物设计领域的突破潜力。


HPC-Ops × SGLang:腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子 80

  • Tags: 开源生态 推理优化 大模型 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
腾讯混元开源HPC-Ops算子库并集成至SGLang主分支,Dynamic Attention与Fused MoE在Hy3模型上TPOT最高降48.8%,显著提升推理效率。


Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding 80

  • Tags: 大模型 AI研究 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出TSR框架与LHRL-VGR算法,通过分层推理和语调级目标奖励增强LLM社交智能,在SOTOPIA基准上使Qwen2.5-7B超过GPT-4o基线7.32%,展现多智能体协商任务的SOTA性能。


蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署 78

  • Tags: 模型发布 开源生态 MoE

  • Source: AI HOT 精选 | 阅读原文

[摘要]
蚂蚁百灵开源新一代混合推理模型Ling-3.0-flash,124B总参数MoE架构,激活参数5.1B,提供FP8/FP4/INT4多版本,支持API及多种部署方式,推动开源生态。


Answer First, Reason Later: Commitment Order in Diffusion LLMs 78

  • Tags: 大模型 扩散模型 推理 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示掩码扩散语言模型在自由顺序解码时容易过早提交答案、丢失推理链,导致GSM8K等推理任务大幅下降;提出前沿门控提交干预可恢复性能并保留并行解码,对扩散LLM设计有重要启示。


谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时 75

  • Tags: 模型发布 AI for Science 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
谷歌DeepMind推出WeatherNext气旋预测模型,高精度预报飓风路径与强度,有效预报时间延长至3天,平均提前24小时,相当于10年气象进展。


EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents 75

  • Tags: 智能体 强化学习 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出EvoHarness-RL,让长时程LLM智能体通过离线学习harness策略,在线自主构建和更新外部状态,在ALFWorld上达96.9%成功率,揭示harness退化和进化机制,对智能体设计有参考价值。


Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations 75

  • Tags: 研究 检索增强 智能体 可解释性

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出READ方法,用可解释的确定性代理操作替代RAG中的黑盒top-k检索,在长文档数值问答上显著优于稠密检索,并指出BM25与READ相当,强调接口设计的重要性。


Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders 75

  • Tags: 论文 语音翻译 多模态 模型发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出MSRT框架,用资源感知的混合语音编码器(MoSE)解决多语言语音翻译中的多语言诅咒,4B模型在45语言全方向翻译上达到SOTA,低资源语言提升显著,代码和模型已开源。


Measuring and Detecting Harmful AI Sycophancy 75

  • Tags: AI安全 大模型 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出CAP框架,系统测量17款LLM中偏好诱导立场反转型谄媚(PSRS)发生率达5%-56%,并探索从单次回复自动检测及跨模型泛化,将开源数据集与代码。


Cross-Architecture Steering Transfer in Language Models: A Systematic Empirical Study 75

  • Tags: 模型研究 可解释性 AI安全 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
首个跨架构语言模型操控向量迁移的系统实证研究,发现1.7B参数以上模型间存在功能可用的几何对齐,可用其他模型的操控向量控制目标模型,无需微调。


MACRO: Markov Chain Routing of Transformer Layers 75

  • Tags: 大模型 推理优化 论文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出MACRO框架,通过马尔可夫链为Transformer层学习任务特定路由,不改参数即可提升推理性能,比现有方法快9.4倍。


The Loss Does Not See the Basis, but Adam Does 75

  • Tags: 优化算法 理论研究 大模型

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
新研究揭示Adam与梯度下降在低秩偏好上的本质差异:优化器的尺度等变性决定其隐式偏差,影响矩阵补全与Transformer表征,为优化器设计提供理论指导。


千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX 75

  • Tags: 大模型 产品发布 智能体

  • Source: AI HOT 精选 | 阅读原文

[摘要]
千问上线思考研究、定时任务、办公助理、语音通话等新功能,并支持旗舰模型 Qwen3.8-MAX,强化复杂推理与自动化办公能力。


MR-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding 75

  • Tags: 基准测试 多模态 模型评测 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出统一证据基础多模态隐喻理解基准M3R-Bench,含1000个图文实例,并推出M3R-Reasoner方法,8B模型在多项指标上超越GPT-5.5和Claude-Sonnet-4.6。


OpenAI 将 Astra 列为首个"关键"网络安全模型 72

  • Tags: AI安全 模型发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI依据准备框架将新模型Astra评估为首个“关键”网络安全模型,计划实施额外安全控制并广泛提供,以增强网络防御能力。


Runway 上线 Seedance 2.5,支持 50 个角色参考 72

  • Tags: 产品发布 视频生成 多模态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Runway上线Seedance 2.5,支持单次生成引用50个角色参考,可制作30秒带音效对白的片段,显著增强视频生成的角色一致性与叙事能力。


EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks 72

  • Tags: 评测 大模型 AI研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准EuroExec用413个欧洲高管决策任务评估前沿LLM,最强模型解决率仅56.9%,远低于专家水平,揭示LLM在开放式复杂问题上的短板。


Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models 72

  • Tags: 大模型 训练方法 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出可验证过程监督(VPS)后训练框架,联合优化答案准确性与推理质量,在棋类和数学推理任务上相比仅结果监督能保持准确性并显著提升推理一致性,对提升大模型推理可靠性有参考价值。


Shrinking the Generation-Verification Gap with Weak Verifiers 72

  • Tags: 模型研究 推理优化 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Weaver框架,通过加权集成多个弱验证器并利用弱监督估计准确性,提升大模型测试时采样选优效果,使Llama 3.3 70B在推理和数学任务上达到o3-mini级精度。