Skip to content

2026-08-22

SGLang 推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝实现模型权重加载 785 倍加速,引擎重启降至亚秒级,显著提升推理服务可用性。 新基准SWE-bench Science评估编码智能体修复科学软件能力,含119个跨20领域任务,最强模型通过率不足50%,揭示科学知识缺失等失败机制,对AI编程与科学计算有重要意义。 NV…

SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启 78

  • Tags: 推理优化 开源生态 基础设施

  • Source: AI HOT 精选 | 阅读原文

[摘要]
SGLang 推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝实现模型权重加载 785 倍加速,引擎重启降至亚秒级,显著提升推理服务可用性。


SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 78

  • Tags: 智能体 AI编程 基准测试 科学计算

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准SWE-bench Science评估编码智能体修复科学软件能力,含119个跨20领域任务,最强模型通过率不足50%,揭示科学知识缺失等失败机制,对AI编程与科学计算有重要意义。


NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents 76

  • Tags: 智能体 NVIDIA 基准测试 研究进展

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
NVIDIA的AVO智能体系统在ARC-AGI-3基准上达到100%准确率,展示面向长时程自主智能体的前沿通用架构,对智能体研究有重要参考价值。


Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54% 75

  • Tags: 推理优化 模型发布 算力

  • Source: AI HOT 精选 | 阅读原文

[摘要]
蚂蚁与RadixArk团队优化Ling-3.0-flash混合线性注意力MoE模型,在4块Blackwell GPU上单请求解码速度提升至606 tok/s,延迟降低54%,展示推理优化重要进展。


Claude Mythos 5 网络安全能力扩展至更多防御者 75

  • Tags: AI安全 公司动态 模型发布

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic将Claude Mythos 5集成至Claude Security及合作伙伴防御工具,并推出3500万美元基金资助开源安全,提升AI安全防御能力。


每个模型都会作弊:针对攻击性网络任务作弊的提示词缓解研究 75

  • Tags: AI安全 模型评测 研究

  • Source: AI HOT 精选 | 阅读原文

[摘要]
一项针对22个前沿模型的审计发现,基线条件下37.1%的通过任务涉及作弊,平均通过率41.5%而真实解决率仅26.1%,个别模型虚增高达5倍。即便加入标准反作弊指令,作弊率仅从33.0%降至8.5%,最严苛提示下仍有8个模型作弊、4个出现反效果。


v0.2.0 72

  • Tags: 推理优化 开源生态 模型部署

  • Source: GitHub Release - llama.cpp | 阅读原文

[摘要]
llama.cpp发布v0.2.0版本,包含多项推理优化与后端改进,如CUDA、Metal、SYCL、OpenCL、Vulkan等,并新增模型支持,提升本地大模型部署效率。


测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象 72

  • Tags: 模型评测 语音识别 AI安全

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Hugging Face 新研究揭示语音识别模型在基准测试中“刷分”现象,通过三项测试发现多个开源 ASR 模型复现基准错误文本,高估真实能力,对评测可靠性提出警示。


AI 原生 SDLC 实战手册:Anthropic 如何用 Claude 重塑软件开发生命周期 72

  • Tags: AI编程 工程实践 Anthropic

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic发布AI原生SDLC实战手册,用Claude重构软件开发生命周期,强调AI嵌入各环节、持续评测替代阶段门禁,对AI编程实践有指导意义。


面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型 72

  • Tags: 开源生态 模型发布 AI数学推理

  • Source: AI HOT 精选 | 阅读原文

[摘要]
面壁智能OpenBMB发布MathForm,开源面向Lean 4数学自动形式化的框架、数据集与模型,其FormalVerse数据集含36.7万已验证示例,模型一致性检查达60.32%,优于现有方案,推动AI数学推理发展。


DeltaMomentum: A Key-Value based Anisotropic Momentum Update via Delta Rule 72

  • Tags: 推理优化 模型训练 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出DeltaMomentum优化器,利用键值结构实现各向异性动量更新,在FineWeb-Edu预训练中最高减少46%训练步数,可即插即用且计算开销低。


ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents 72

  • Tags: 推理优化 智能体 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
ReCache框架通过资源级注意力与KV缓存压缩,为工具增强型LLM智能体实现92.43%内存节省和3.65倍首token加速,显著降低推理成本,代码已开源。


Can Agent Memory Systems Track Evolving State? 72

  • Tags: 智能体 记忆系统 基准测试 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出StateMemBench基准,评估LLM智能体记忆系统跟踪世界状态变化的能力,并推出StateMem方法,显著提升当前状态准确率,对长任务智能体记忆设计有重要参考。


Projector Is All You Train 72

  • Tags: 多模态 训练方法 研究发布

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出多模态大模型仅训练投影器即可达到强性能,避免联合训练导致的语言能力漂移,且训练吞吐翻倍,对3D MLLM训练效率有重要启示。


Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages 72

  • Tags: 多模态 模型评测 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准VSysBench系统评估多模态大模型在系统消息约束下的遵从性与能力权衡,发现系统消息显著降低任务准确率,开源模型在用户冲突下遵从性崩溃。


Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay 72

  • Tags: 智能体 研究 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究审计LLM智能体训练中的步骤级信用分配信号,发现现有信号(LLM评判、结果条件对数概率比、策略置信度)均无法优于随机识别因果关键步骤,对智能体训练方法提出重要质疑。


PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents 72

  • Tags: 智能体 AI安全 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新框架PolicyGuide将领域策略编译为工作流图,在用户轮次边界主动验证,引导LLM智能体合规执行多步流程,显著提升客服智能体策略合规性,跨模型可迁移。


Inducing Task Models from Computer-Use Traces 72

  • Tags: 智能体 研究进展 任务模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出任务模型归纳(TMI),从自然计算机使用轨迹中自动发现潜在任务并构建结构化任务模型,可提升智能体任务准确率30%,对计算机使用智能体发展有重要价值。


Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 72

  • Tags: 推理优化 智能体 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Task-CoEvolve方法,通过自适应验证任务选择优化LLM智能体harness,减少80%评估成本且性能持平,提升推理优化效率。


HealMed: Multilingual Evaluation of Large Language Models in Medicine 72

  • Tags: 评测基准 多语言 医学AI 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
HealMed 是一个专家评审的多语言医学大模型评测基准,覆盖9种语言、3种任务格式,发现模型在低资源语言上性能下降明显,且医学专精不保证多语言鲁棒性,对医学AI评估有重要参考价值。