Skip to content

2026-07-28

Kimi 开源 2.8T 参数 MoE 模型 K3,具备原生视觉理解和 1M 上下文窗口,单位计算智能提升 2.5 倍,同时开源注意力内核、MoE 通信库及智能体基础设施。 月之暗面开源2.8T参数混合架构模型Kimi K3,SGLang和Miles当日支持推理和RL训练,单卡解码速度约113 tok/s,结合推测解码可达423 tok/s。 提出14个能力…

Kimi K3 开源:2.8T MoE 模型与技术报告 92

  • Tags: 模型发布 开源生态 大模型 智能体

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Kimi 开源 2.8T 参数 MoE 模型 K3,具备原生视觉理解和 1M 上下文窗口,单位计算智能提升 2.5 倍,同时开源注意力内核、MoE 通信库及智能体基础设施。


SGLang 和 Miles 为月之暗面 2.8T 参数 Kimi K3 模型提供发布当日支持 85

  • Tags: 模型发布 大模型 开源生态 推理优化

  • Source: AI HOT 精选 | 阅读原文

[摘要]
月之暗面开源2.8T参数混合架构模型Kimi K3,SGLang和Miles当日支持推理和RL训练,单卡解码速度约113 tok/s,结合推测解码可达423 tok/s。


From Isolated Tasks to Structured Capabilities: A Multilayer Taxonomy for Large Language Models 85

  • Tags: 大模型 模型评估 能力分类

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出14个能力域、91个子技能的多层LLM分类法,基于3万余篇论文映射揭示研究注意力集中于语义理解与推理,其他领域不足2%,为评估和训练提供结构化框架。


Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning 85

  • Tags: 训练方法 强化学习 推理优化 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
MetaEvolve 提出基于强化学习的自我进化元技能训练框架,在编码任务中分布外提升24%,开放问题提升46.9%,为自主进化AI提供新路径。


Ground Truth First: A Longitudinal Evaluation Instrument for Agent Memory, and the Tenure Crossover in Memory-Architecture Rankings 85

  • Tags: 智能体 记忆评测 研究 模型评估

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出纵向智能体记忆评估工具Veracium与合成语料库,发现记忆架构排名随历史长度反转,为LLM记忆研究提供新基准。


Self-Poisoning in Adaptive Out-of-Distribution Detection: A Sharp-Threshold Theory and Certified Label-Free Calibration 85

  • Tags: 大模型 AI安全 理论研究 算法

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
该论文提出自适应OOD检测自毒化的尖点阈值理论,证明无标签条件下污染与漂移不可区分,并给出有证书的无标签校准方法,对AI安全有重要理论指导意义。


Learning to Reason for Factuality 82

  • Tags: 大模型 推理优化 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出新奖励函数结合在线强化学习训练推理大模型,在六项长文本事实性基准上平均降低23.1%幻觉率,同时提升回答细节与相关性。


NVIDIA 等多家行业领袖联合成立 Open Secure AI Alliance,推动 AI 安全与防御开源化 80

  • Tags: AI安全 开源生态 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
NVIDIA、Microsoft、Hugging Face等联合成立Open Secure AI Alliance,推动开源AI安全防御,影响行业安全生态。


NVIDIA Ising Enables Fully Automated Quantum Computer Calibration with Enhanced In-Context Learning 80

  • Tags: 模型发布 开源生态 量子计算 AI基础设施

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
NVIDIA 发布开源视觉语言模型 Ising Calibration,实现量子计算机全自动校准,利用增强的上下文学习提升效率与准确性,推动量子计算基础设施发展。


GitHub Copilot 发布"Harness"工作流:用单一工具完成原型、规划、实现与代码审查 80

  • Tags: 产品发布 AI编程 工作流

  • Source: AI HOT 精选 | 阅读原文

[摘要]
GitHub Copilot推出Harness工作流,整合原型、规划、实现到代码审查,提升开发效率,减少工具切换损耗。


Scaling Native Multimodal Pre-Training From Scratch 80

  • Tags: 多模态 模型研究 Scaling Law 预训练

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究原生多模态预训练从零开始的缩放规律,发现语言和多模态目标有不同的缩放行为,为可预测扩展多模态基础模型奠定基础。


Can AI Debias the News? LLM Interventions Improve Cross-Partisan Receptivity but LLMs Overestimate Their Own Effectiveness 80

  • Tags: 大模型 AI安全 AI伦理 新闻去偏

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究发现LLM改写新闻框架可改善跨党派信任,但模型高估自身效果且心理预测失准,需人工监督。


Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills 80

  • Tags: 研究进展 LLM训练 强化学习 开源

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Skill Self-Play框架,通过技能自我对弈实现LLM能力持续进化,在工具使用和推理基准上提升性能,已开源。


Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision 80

  • Tags: 语音大模型 多语言 模型蒸馏 指令跟随

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出语言感知蒸馏方法,仅用ASR数据训练多语言指令跟随语音LLM,在指令跟随和QA基准上分别提升14%和32%。


Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents 80

  • Tags: 研究进展 智能体 多模态 具身智能

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出MissionBench基准,评估多模态大模型在3D空中环境中的零样本任务级具身能力,最强模型成功率不足35%,显示多步推理与规划仍是瓶颈。


SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation 80

  • Tags: RAG 研究发布 推理优化 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
SURE-RAG提出新的证据充分性验证方法,通过聚合协议提升RAG多跳推理的可信度和可审计性,在基准上取得显著性能提升。


Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science 80

  • Tags: AI安全 模型行为 透明度

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示商业LLM对伪科学声明的验证受部署配置影响,Grok在X默认模式下给予高评分,且存在无声更新,引发AI透明度与问责担忧。


b10142 80

  • Tags: 开源生态 模型支持 推理优化

  • Source: GitHub Release - llama.cpp | 阅读原文

[摘要]
llama.cpp合并PR,为MiniMax-M3模型添加视觉支持与推理优化,包括稀疏注意力、多流支持及缓存改进,提升开源部署效率。


LeAct: Learning to Reason from Expert Actions 80

  • Tags: 大模型 推理优化 模型训练 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
LeAct 方法从专家系统(如游戏引擎、规划器)隐式动作中恢复推理链,作为新推理数据源,在多个游戏与机器人任务上显著提升学生模型性能,较最强基线提升5倍。


Local-Global Geometric Insights for Graph Neural Networks via Entropic Curvature 80

  • Tags: 图神经网络 研究论文 理论创新

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出图上的熵曲率全局框架,统一解决GNN过平滑与过挤压,并导出E-Gate聚合器、ENT编码、MCR重连等实用机制,在节点分类上表现优异。