2026-07-28
Kimi 开源 2.8T 参数 MoE 模型 K3,具备原生视觉理解和 1M 上下文窗口,单位计算智能提升 2.5 倍,同时开源注意力内核、MoE 通信库及智能体基础设施。 月之暗面开源2.8T参数混合架构模型Kimi K3,SGLang和Miles当日支持推理和RL训练,单卡解码速度约113 tok/s,结合推测解码可达423 tok/s。 提出14个能力…
Kimi K3 开源:2.8T MoE 模型与技术报告 92
Tags:
模型发布开源生态大模型智能体Source:
AI HOT 精选| 阅读原文
[摘要]
Kimi 开源 2.8T 参数 MoE 模型 K3,具备原生视觉理解和 1M 上下文窗口,单位计算智能提升 2.5 倍,同时开源注意力内核、MoE 通信库及智能体基础设施。
SGLang 和 Miles 为月之暗面 2.8T 参数 Kimi K3 模型提供发布当日支持 85
Tags:
模型发布大模型开源生态推理优化Source:
AI HOT 精选| 阅读原文
[摘要]
月之暗面开源2.8T参数混合架构模型Kimi K3,SGLang和Miles当日支持推理和RL训练,单卡解码速度约113 tok/s,结合推测解码可达423 tok/s。
From Isolated Tasks to Structured Capabilities: A Multilayer Taxonomy for Large Language Models 85
Tags:
大模型模型评估能力分类Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出14个能力域、91个子技能的多层LLM分类法,基于3万余篇论文映射揭示研究注意力集中于语义理解与推理,其他领域不足2%,为评估和训练提供结构化框架。
Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning 85
Tags:
训练方法强化学习推理优化大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
MetaEvolve 提出基于强化学习的自我进化元技能训练框架,在编码任务中分布外提升24%,开放问题提升46.9%,为自主进化AI提供新路径。
Ground Truth First: A Longitudinal Evaluation Instrument for Agent Memory, and the Tenure Crossover in Memory-Architecture Rankings 85
Tags:
智能体记忆评测研究模型评估Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出纵向智能体记忆评估工具Veracium与合成语料库,发现记忆架构排名随历史长度反转,为LLM记忆研究提供新基准。
Self-Poisoning in Adaptive Out-of-Distribution Detection: A Sharp-Threshold Theory and Certified Label-Free Calibration 85
Tags:
大模型AI安全理论研究算法Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
该论文提出自适应OOD检测自毒化的尖点阈值理论,证明无标签条件下污染与漂移不可区分,并给出有证书的无标签校准方法,对AI安全有重要理论指导意义。
Learning to Reason for Factuality 82
Tags:
大模型推理优化AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出新奖励函数结合在线强化学习训练推理大模型,在六项长文本事实性基准上平均降低23.1%幻觉率,同时提升回答细节与相关性。
NVIDIA 等多家行业领袖联合成立 Open Secure AI Alliance,推动 AI 安全与防御开源化 80
Tags:
AI安全开源生态公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
NVIDIA、Microsoft、Hugging Face等联合成立Open Secure AI Alliance,推动开源AI安全防御,影响行业安全生态。
NVIDIA Ising Enables Fully Automated Quantum Computer Calibration with Enhanced In-Context Learning 80
Tags:
模型发布开源生态量子计算AI基础设施Source:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
NVIDIA 发布开源视觉语言模型 Ising Calibration,实现量子计算机全自动校准,利用增强的上下文学习提升效率与准确性,推动量子计算基础设施发展。
GitHub Copilot 发布"Harness"工作流:用单一工具完成原型、规划、实现与代码审查 80
Tags:
产品发布AI编程工作流Source:
AI HOT 精选| 阅读原文
[摘要]
GitHub Copilot推出Harness工作流,整合原型、规划、实现到代码审查,提升开发效率,减少工具切换损耗。
Scaling Native Multimodal Pre-Training From Scratch 80
Tags:
多模态模型研究Scaling Law预训练Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究原生多模态预训练从零开始的缩放规律,发现语言和多模态目标有不同的缩放行为,为可预测扩展多模态基础模型奠定基础。
Can AI Debias the News? LLM Interventions Improve Cross-Partisan Receptivity but LLMs Overestimate Their Own Effectiveness 80
Tags:
大模型AI安全AI伦理新闻去偏Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究发现LLM改写新闻框架可改善跨党派信任,但模型高估自身效果且心理预测失准,需人工监督。
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills 80
Tags:
研究进展LLM训练强化学习开源Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Skill Self-Play框架,通过技能自我对弈实现LLM能力持续进化,在工具使用和推理基准上提升性能,已开源。
Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision 80
Tags:
语音大模型多语言模型蒸馏指令跟随Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出语言感知蒸馏方法,仅用ASR数据训练多语言指令跟随语音LLM,在指令跟随和QA基准上分别提升14%和32%。
Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents 80
Tags:
研究进展智能体多模态具身智能Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出MissionBench基准,评估多模态大模型在3D空中环境中的零样本任务级具身能力,最强模型成功率不足35%,显示多步推理与规划仍是瓶颈。
SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation 80
Tags:
RAG研究发布推理优化AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
SURE-RAG提出新的证据充分性验证方法,通过聚合协议提升RAG多跳推理的可信度和可审计性,在基准上取得显著性能提升。
Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science 80
Tags:
AI安全模型行为透明度Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究揭示商业LLM对伪科学声明的验证受部署配置影响,Grok在X默认模式下给予高评分,且存在无声更新,引发AI透明度与问责担忧。
b10142 80
Tags:
开源生态模型支持推理优化Source:
GitHub Release - llama.cpp| 阅读原文
[摘要]
llama.cpp合并PR,为MiniMax-M3模型添加视觉支持与推理优化,包括稀疏注意力、多流支持及缓存改进,提升开源部署效率。
LeAct: Learning to Reason from Expert Actions 80
Tags:
大模型推理优化模型训练智能体Source:
arXiv Computation and Language| 阅读原文
[摘要]
LeAct 方法从专家系统(如游戏引擎、规划器)隐式动作中恢复推理链,作为新推理数据源,在多个游戏与机器人任务上显著提升学生模型性能,较最强基线提升5倍。
Local-Global Geometric Insights for Graph Neural Networks via Entropic Curvature 80
Tags:
图神经网络研究论文理论创新Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
提出图上的熵曲率全局框架,统一解决GNN过平滑与过挤压,并导出E-Gate聚合器、ENT编码、MCR重连等实用机制,在节点分类上表现优异。