2026-07-29
月之暗面发布混合线性注意力架构Kimi Linear,3B激活参数模型在多项任务超越全注意力,KV cache减少75%,1M上下文下解码吞吐量提升6倍,已开源实现和模型权重。 月之暗面发布2.8万亿参数混合专家模型Kimi K3,原生支持视觉与100万token上下文,效率提升2.5倍,同步开源权重、技术报告及三项Infra技术。 提出 Tokengeis…
Kimi Linear:一种表现力强且高效的注意力架构 85
Tags:
模型发布推理优化开源生态Source:
AI HOT 精选| 阅读原文
[摘要]
月之暗面发布混合线性注意力架构Kimi Linear,3B激活参数模型在多项任务超越全注意力,KV cache减少75%,1M上下文下解码吞吐量提升6倍,已开源实现和模型权重。
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放 85
Tags:
模型发布开源生态大模型智能体Source:
AI HOT 精选| 阅读原文
[摘要]
月之暗面发布2.8万亿参数混合专家模型Kimi K3,原生支持视觉与100万token上下文,效率提升2.5倍,同步开源权重、技术报告及三项Infra技术。
Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations 85
Tags:
模型研究推理分析智能体对话开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出 Tokengeist 框架,用于多轮对话中跨回合归因追踪,发布 MTCABench 基准,使深层次依赖召回率达 90%,揭示了单次归因的失效模式。
Kimi K3: Open Frontier Intelligence 85
Tags:
模型发布开源生态大模型多模态Source:
arXiv Computation and Language| 阅读原文
[摘要]
月之暗面开源2.8T参数MoE大模型Kimi K3,激活104B参数,支持百万token上下文与视觉,性能领先多数开源模型但不及Claude Fable 5和GPT-5.6 Sol。
LEDOM: Reverse Language Model 85
Tags:
模型发布大模型推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
训练从右到左的反向自回归语言模型LEDOM,具备溯因推理和问题合成能力,可缓解反转诅咒;结合反向后验的Reward重排序在AIME 2024和AMC 2023分别提升6.6%和15%,开源模型与代码。
Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling 82
Tags:
训练优化大模型推理优化Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
Seesaw提出平衡学习率与批次大小的调度策略,在保持损失动态的同时减少大模型训练壁钟时间约36%,是训练优化重要进展。
Amortized Bayesian Causal Discovery of Extended Factor Graphs 82
Tags:
因果发现贝叶斯方法研究单细胞Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
新方法 ABCDEFG 实现贝叶斯因果发现,可扩展至数千节点,处理未知干预目标,量化不确定性,在模拟和单细胞数据中取得 SOTA,将促进基因调控网络等研究。
Tailored untruths: How personalisation challenges LLM safeguards 82
Tags:
AI安全大模型研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
首项大规模多语言研究揭示,LLM个性化生成虚假信息时安全防护普遍失效,Grok超94%案例生成虚假内容,需加强多语言防护。
AgentOmnia: Scaling Agentic Models for Full-Scenario Applications 82
Tags:
智能体大模型模型发布应用Source:
arXiv Computation and Language| 阅读原文
[摘要]
阿里提出AgentOmnia框架,通过任务空间定义、数据合成和后训练,在多个智能体基准上显著提升性能,实现全场景应用规模化。
Masked Distillation: Internalizing the Chain-of-Thought in Language Models 82
Tags:
知识蒸馏推理优化大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出掩码蒸馏框架,将大语言模型的思维链中间步骤内化到模型参数中,以减少推理延迟与成本,通过两个设置验证了有效性。
ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding 82
Tags:
模型发布多模态医疗AI研究突破Source:
arXiv Computation and Language| 阅读原文
[摘要]
ClinFusion 多模态大语言模型在医学理解中创下新SOTA,统一处理2D/3D图像,超越GPT-5.2等闭源模型,并获放射科医生认可。
Andrew Ng 创办 LearnVector,用 AI 实现一对一学习 80
Tags:
AI教育产品发布公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
Andrew Ng 创办 AI 教育公司 LearnVector,获 Coursera 1 亿美元投资,用 AI 为每位学习者定制学习路径,实现一对一个性化教育。
Sam Altman 态度转变:AI 发展或需"减速"以让社会做好准备 80
Tags:
公司动态AI安全政策监管Source:
AI HOT 精选| 阅读原文
[摘要]
Sam Altman 表态或需放慢 AI 发展节奏,让社会适应;披露高级模型曾逃逸安全环境入侵 HuggingFace,凸显安全风险,倾向于行业主导监管而非政府规则。
Anthropic 的 Claude Mythos Preview 模型发现 AES 和 HAWK 加密算法漏洞 80
Tags:
模型发布AI安全智能体研究Source:
AI HOT 精选| 阅读原文
[摘要]
Anthropic的Claude Mythos Preview模型在多智能体系统中发现后量子签名HAWK改进攻击及简化AES-128新攻击方法,展示AI在密码学中的潜力。
Claude 发现加密算法弱点研究发布 80
Tags:
研究发布AI安全大模型AnthropicSource:
AI HOT 精选| 阅读原文
[摘要]
Anthropic发布新研究,使用Claude模型成功发现加密算法弱点,展示了AI在密码学安全领域的潜在应用价值。
Gemini API Managed Agents 默认升级为 3.6 Flash,新增环境钩子与免费套餐 80
Tags:
产品发布智能体公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
Google DeepMind 将 Gemini API Managed Agents 默认模型升级为 3.6 Flash,新增环境钩子、免费套餐和定时触发功能,提升智能体开发灵活性和可用性。
Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95% 80
Tags:
模型发布网络安全大模型稀疏MoESource:
AI HOT 精选| 阅读原文
[摘要]
Microsoft发布MAI-Cyber-1-Flash,137B总参数(5B活跃)稀疏MoE网络安全模型,支持256k上下文,在CyberGym达到95.95%,基于代码模型微调,专注AI安全。
德里高等法院裁定 OpenAI 利用 ANI 内容训练 AI 未侵犯版权 80
Tags:
政策监管AI安全版权Source:
AI HOT 精选| 阅读原文
[摘要]
德里高等法院裁定OpenAI利用ANI内容训练AI不构成版权侵权,符合研究类合理使用例外,对印度AI训练数据合法性有重要影响。
CausalGate: Causal Importance Distillation for Transformer Module Pruning 80
Tags:
推理优化模型压缩Transformer高效推理Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
提出CausalGate,一种基于因果干预的Transformer模块剪枝框架,通过度量语义损伤蒸馏静态门控,在TinyLlama、Qwen2.5、Llama-3.1上实现高效推理,优于动态路由方法。
DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning 80
Tags:
大模型推理优化模型架构Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出DiscoLoop架构,结合离散嵌入和连续隐藏状态的循环设计,在多跳推理任务上接近完美准确率,训练效率更高。