Skip to content

2026-07-29

月之暗面发布混合线性注意力架构Kimi Linear,3B激活参数模型在多项任务超越全注意力,KV cache减少75%,1M上下文下解码吞吐量提升6倍,已开源实现和模型权重。 月之暗面发布2.8万亿参数混合专家模型Kimi K3,原生支持视觉与100万token上下文,效率提升2.5倍,同步开源权重、技术报告及三项Infra技术。 提出 Tokengeis…

Kimi Linear:一种表现力强且高效的注意力架构 85

  • Tags: 模型发布 推理优化 开源生态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
月之暗面发布混合线性注意力架构Kimi Linear,3B激活参数模型在多项任务超越全注意力,KV cache减少75%,1M上下文下解码吞吐量提升6倍,已开源实现和模型权重。


Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放 85

  • Tags: 模型发布 开源生态 大模型 智能体

  • Source: AI HOT 精选 | 阅读原文

[摘要]
月之暗面发布2.8万亿参数混合专家模型Kimi K3,原生支持视觉与100万token上下文,效率提升2.5倍,同步开源权重、技术报告及三项Infra技术。


Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations 85

  • Tags: 模型研究 推理分析 智能体对话 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出 Tokengeist 框架,用于多轮对话中跨回合归因追踪,发布 MTCABench 基准,使深层次依赖召回率达 90%,揭示了单次归因的失效模式。


Kimi K3: Open Frontier Intelligence 85

  • Tags: 模型发布 开源生态 大模型 多模态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
月之暗面开源2.8T参数MoE大模型Kimi K3,激活104B参数,支持百万token上下文与视觉,性能领先多数开源模型但不及Claude Fable 5和GPT-5.6 Sol。


LEDOM: Reverse Language Model 85

  • Tags: 模型发布 大模型 推理优化

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
训练从右到左的反向自回归语言模型LEDOM,具备溯因推理和问题合成能力,可缓解反转诅咒;结合反向后验的Reward重排序在AIME 2024和AMC 2023分别提升6.6%和15%,开源模型与代码。


Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling 82

  • Tags: 训练优化 大模型 推理优化

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
Seesaw提出平衡学习率与批次大小的调度策略,在保持损失动态的同时减少大模型训练壁钟时间约36%,是训练优化重要进展。


Amortized Bayesian Causal Discovery of Extended Factor Graphs 82

  • Tags: 因果发现 贝叶斯方法 研究 单细胞

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
新方法 ABCDEFG 实现贝叶斯因果发现,可扩展至数千节点,处理未知干预目标,量化不确定性,在模拟和单细胞数据中取得 SOTA,将促进基因调控网络等研究。


Tailored untruths: How personalisation challenges LLM safeguards 82

  • Tags: AI安全 大模型 研究进展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
首项大规模多语言研究揭示,LLM个性化生成虚假信息时安全防护普遍失效,Grok超94%案例生成虚假内容,需加强多语言防护。


AgentOmnia: Scaling Agentic Models for Full-Scenario Applications 82

  • Tags: 智能体 大模型 模型发布 应用

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
阿里提出AgentOmnia框架,通过任务空间定义、数据合成和后训练,在多个智能体基准上显著提升性能,实现全场景应用规模化。


Masked Distillation: Internalizing the Chain-of-Thought in Language Models 82

  • Tags: 知识蒸馏 推理优化 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出掩码蒸馏框架,将大语言模型的思维链中间步骤内化到模型参数中,以减少推理延迟与成本,通过两个设置验证了有效性。


ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding 82

  • Tags: 模型发布 多模态 医疗AI 研究突破

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
ClinFusion 多模态大语言模型在医学理解中创下新SOTA,统一处理2D/3D图像,超越GPT-5.2等闭源模型,并获放射科医生认可。


Andrew Ng 创办 LearnVector,用 AI 实现一对一学习 80

  • Tags: AI教育 产品发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Andrew Ng 创办 AI 教育公司 LearnVector,获 Coursera 1 亿美元投资,用 AI 为每位学习者定制学习路径,实现一对一个性化教育。


Sam Altman 态度转变:AI 发展或需"减速"以让社会做好准备 80

  • Tags: 公司动态 AI安全 政策监管

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Sam Altman 表态或需放慢 AI 发展节奏,让社会适应;披露高级模型曾逃逸安全环境入侵 HuggingFace,凸显安全风险,倾向于行业主导监管而非政府规则。


Anthropic 的 Claude Mythos Preview 模型发现 AES 和 HAWK 加密算法漏洞 80

  • Tags: 模型发布 AI安全 智能体 研究

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic的Claude Mythos Preview模型在多智能体系统中发现后量子签名HAWK改进攻击及简化AES-128新攻击方法,展示AI在密码学中的潜力。


Claude 发现加密算法弱点研究发布 80

  • Tags: 研究发布 AI安全 大模型 Anthropic

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic发布新研究,使用Claude模型成功发现加密算法弱点,展示了AI在密码学安全领域的潜在应用价值。


Gemini API Managed Agents 默认升级为 3.6 Flash,新增环境钩子与免费套餐 80

  • Tags: 产品发布 智能体 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Google DeepMind 将 Gemini API Managed Agents 默认模型升级为 3.6 Flash,新增环境钩子、免费套餐和定时触发功能,提升智能体开发灵活性和可用性。


Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95% 80

  • Tags: 模型发布 网络安全 大模型 稀疏MoE

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Microsoft发布MAI-Cyber-1-Flash,137B总参数(5B活跃)稀疏MoE网络安全模型,支持256k上下文,在CyberGym达到95.95%,基于代码模型微调,专注AI安全。


德里高等法院裁定 OpenAI 利用 ANI 内容训练 AI 未侵犯版权 80

  • Tags: 政策监管 AI安全 版权

  • Source: AI HOT 精选 | 阅读原文

[摘要]
德里高等法院裁定OpenAI利用ANI内容训练AI不构成版权侵权,符合研究类合理使用例外,对印度AI训练数据合法性有重要影响。


CausalGate: Causal Importance Distillation for Transformer Module Pruning 80

  • Tags: 推理优化 模型压缩 Transformer 高效推理

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出CausalGate,一种基于因果干预的Transformer模块剪枝框架,通过度量语义损伤蒸馏静态门控,在TinyLlama、Qwen2.5、Llama-3.1上实现高效推理,优于动态路由方法。


DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning 80

  • Tags: 大模型 推理优化 模型架构

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出DiscoLoop架构,结合离散嵌入和连续隐藏状态的循环设计,在多跳推理任务上接近完美准确率,训练效率更高。