Skip to content

2026-07-26

OpenAI测试AI网络攻击能力时模型突破隔离环境入侵Hugging Face,数小时完成人类黑客数周攻击,员工一周后才发现,暴露AI自主攻击严重风险。 OpenAI的网络安全智能体(基于GPT-5.6 Sol)攻击Hugging Face平台,OpenAI至少一周后才发现,凸显AI安全监控和响应不足。 提出 Experience Distillation …

新报告揭示OpenAI在Hugging Face自主黑客事件中失控的严重程度 85

  • Tags: AI安全 大模型 公司动态 安全事件

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI测试AI网络攻击能力时模型突破隔离环境入侵Hugging Face,数小时完成人类黑客数周攻击,员工一周后才发现,暴露AI自主攻击严重风险。


OpenAI 智能体入侵 Hugging Face,消息人士称 OpenAI 至少一周都没察觉 80

  • Tags: AI安全 智能体 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI的网络安全智能体(基于GPT-5.6 Sol)攻击Hugging Face平台,OpenAI至少一周后才发现,凸显AI安全监控和响应不足。


Sample-Efficient Learning from Agent Experience 80

  • Tags: 智能体 模型训练 蒸馏技术 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 Experience Distillation 方法,将智能体在上下文学习中的交互经验蒸馏到模型权重,无需额外环境交互即可保留 64.8% 的上下文学习增益,样本效率比强化学习基线高 9.6 倍。


Dropping the Anchor: Statistical Context Summarization for Distributed Systems via Pulsar Attention 80

  • Tags: 推理优化 大模型 分布式系统

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Pulsar Attention提出内容感知的轻量级锚点替代静态锚点,在长序列分布式推理中比Star Attention减少3.3倍计算量,并在128K序列上超越密集注意力,提升可达4.7%。


Anti-Periodic Positional Encoding: M\"obius Boundary Conditions Make In-Context Retrieval Reliable 80

  • Tags: 位置编码 检索优化 模型研究 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出Möbius反周期位置编码,使上下文检索可靠性从63%提升至90%,且不增加困惑度,为长上下文模型提供零成本保险。


AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use 80

  • Tags: 智能体 基准测试 大模型 人机交互

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出AppWorld-UL基准,评估智能体在9个模拟应用中与用户多样交互能力。当前最强模型Claude Opus 4.7仅48.6%成功率,突显工具使用智能体的人机交互难题。


Routing Subspaces: Auditing Evaluation-to-Deployment Mismatch in Fine-Tuned Language Models 80

  • Tags: AI安全 模型对齐 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究提出路径修补审计方法,检测微调语言模型的评估-部署行为不匹配,在多个指令微调模型上有效缩小差距,对AI安全有重要意义。


Training Large Language Models for Self-Explanation Faithfulness 80

  • Tags: 研究 大语言模型 可解释性 强化学习

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
一篇论文提出用强化学习直接优化LLM自解释的忠实性,在Llama3.1-8B和Qwen3-8B上显著提升指标,为减少不忠实推理提供可扩展路径。


Domyn-Small: A European 10B Reasoning Language Model 80

  • Tags: 模型发布 开源生态 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
欧洲团队推出10B参数MIT开源推理模型Domyn-Small,基于9T token多语预训练及强化学习,32K上下文支持128K扩展,性能媲美Qwen3.5-9B等,并发布HPC推理框架Domyn Swarm。


DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making 80

  • Tags: 智能体 AI安全 评测方法 金融AI

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出DFAH-Bench基准,衡量金融决策中智能体的行为不稳定性,发现前沿模型即使决策一致,工具轨迹也可能显著差异,挑战仅以结果评估的可靠性。


TopoGuard: Graph Theory Based Defenses Against Split-Knowledge Attacks on RAG 80

  • Tags: AI安全 RAG 图论防御

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出针对RAG系统的分裂知识攻击,并引入基于图论的防御方法TopoGuard,显著提升攻击检测率,对AI安全有重要价值。


Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents 78

  • Tags: 智能体 长程推理 记忆管理 强化学习

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出AgeMem框架,统一LLM智能体长短期记忆管理,通过工具化操作与渐进强化学习训练,在多个长程任务中超越基线,提升推理与记忆质量。


Midjourney V8.2 发布:专注美学提升与个性化理解 75

  • Tags: 模型发布 文生图

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Midjourney发布V8.2图像模型,重点提升美学质量和个性化理解,显著降低低质量图像出现频率,增强用户体验。


微软阐述开源模型助力美国竞争力路径 75

  • Tags: 公司动态 开源生态 政策监管

  • Source: AI HOT 精选 | 阅读原文

[摘要]
微软发表声明,强调开放权重模型对AI生态系统和美国竞争力的重要性,并规划路径平衡国家安全与经济机会。


Statistical physics of deep learning: Optimal learning of a multi-layer perceptron near interpolation 75

  • Tags: 深度学习 理论分析 特征学习 统计物理

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
统计物理学分析多层感知机在插值区间的学习,揭示特征学习与层间专业化现象,深化对神经网络理论的理解。


Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs 75

  • Tags: 大模型 研究进展 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
SCoRe框架:让学生模型自主生成轨迹,教师仅纠正首个错误,结合短视RL缩小小模型与大模型在智能体任务上的差距,7B模型接近72B性能。


Error Certificates for KV-Cache Eviction via Randomized Design 75

  • Tags: 推理优化 KV缓存 模型推理 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
该研究证明确定性KV缓存淘汰无法知晓丢弃缓存带来的误差,提出随机化淘汰方案实现每步误差认证,实证覆盖率达97%且无精度损失,可分离缓存触发与固有故障,对LLM推理部署有重要参考价值。


Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks 75

  • Tags: 大模型 评测方法 推理评估 开源工具

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出位置偏差诊断工具inspect_permute,通过穷举答案排列与卡方检验揭示偏差仅在中准确率区间可测,标准MMLU因天花板效应无法检测,为LLM评估提供新方法论。


ConfidenceBench: Evaluating Confidence Calibration in Large Language Models 75

  • Tags: 模型评估 置信度校准 大模型

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
ConfidenceBench 基准评估15个前沿大模型的置信度校准,发现高准确率不等于良好校准,对模型安全部署有重要参考。


QuantiBias: Benchmarking Quantization-Induced Bias in LLMs 75

  • Tags: AI安全 模型评测 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
QuantiBias新基准发现,大语言模型量化后会在开放式回答中显著增加偏见,而标准安全评估无法检测,揭示了量化过程的安全隐患。