2026-08-20
GLM-5.3 API上线,在AA综合智能指数中获60分,与闭源旗舰并列,同时是开源模型第一,成本更低,权重下周开源。 Mojo 语言正式开源,采用 Apache 2.0 许可证,编译器与工具链全面开放,标准库已接受社区贡献,对 AI 编程生态有重要影响。 MoNe提出模块化神经记忆,以测试时学习为冻结预训练模型扩展长上下文,实现O(1)查询成本,128K长…
GLM-5.3上线:AA智能指数60分并列开源第一,成本更低 85
Tags:
模型发布开源生态大模型Source:
AI HOT 精选| 阅读原文
[摘要]
GLM-5.3 API上线,在AA综合智能指数中获60分,与闭源旗舰并列,同时是开源模型第一,成本更低,权重下周开源。
Mojo 语言正式开源,编译器与工具链全面开放 80
Tags:
开源生态编程语言编译器AI工具链Source:
AI HOT 精选| 阅读原文
[摘要]
Mojo 语言正式开源,采用 Apache 2.0 许可证,编译器与工具链全面开放,标准库已接受社区贡献,对 AI 编程生态有重要影响。
MoNe: Modular Neural Memory for Efficient Long Context Inference 78
Tags:
推理优化长上下文模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
MoNe提出模块化神经记忆,以测试时学习为冻结预训练模型扩展长上下文,实现O(1)查询成本,128K长度下计算和显存降低约80%,且可泛化到超出原生窗口的长度。
PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX 78
Tags:
基准测试GPU优化大模型性能优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准PTXBench用于评估和训练LLM利用架构特定PTX优化GPU内核,在H100/B200上测试GEMM与注意力,发现现有模型能力不均,微调Qwen3.6-27B有改进但泛化有限,为AI算力优化提供新测试平台。
Cross-Model Memory Transfer via Target-Side Reader Adaptation 76
Tags:
模型研究知识记忆跨模型迁移大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
该研究探讨跨模型记忆迁移,发现当Engram式哈希记忆迁移到不同骨干模型时,目标侧阅读器适配比冻结记忆本身更关键,可通过轻量训练实现接近同模型的效果,为可复用外部知识构件提供新思路。
OpenRouter 宣布加入 Stripe 75
Tags:
公司动态AI基础设施开发者生态Source:
AI HOT 精选| 阅读原文
[摘要]
OpenRouter 宣布与 Stripe 合并,继续独立运营。该平台日处理超10万亿 token,服务超1000万开发者,是重要 AI 推理基础设施,合并可能影响全球 AI 服务生态。
Do Large Language Models Play Six Degrees of Separation? Measuring Topological Compression in Long-Context Manifolds 75
Tags:
大模型推理机制AI安全研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究证明大模型隐藏状态流形在深层推理层呈小世界网络,长距离语义跳转限制在六度分隔内,并可用于RAG幻觉检测。
Chain-of-Experience for Continual LLM Improvement 75
Tags:
大模型研究推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出Chain-of-Experience(CoE),让LLM在测试时通过迭代交互积累经验持续改进,在数学、编程等任务上比零样本基线提升5.6%,API成本降低19%,展示了推理时学习的新方向。
Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation 75
Tags:
强化学习大模型训练优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出基于图结构的在线难度估计方法,优化RLVR训练中的探索预算分配,提升大模型推理能力训练效率,可集成到现有调度器。
The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning 75
Tags:
大模型模型评测推理能力开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
IOL-AI Challenge面向国际语言学奥林匹克难题测试LLM推理,Claude Opus 4.8获金牌,但资源受限系统仅达参赛者后5%;发现能力不由规模决定,自动评测与人工一致,语言推理是通用推理的强基准。
Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning 75
Tags:
模型发布智能体技术报告大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
Writer发布Palmyra x6技术报告,基于MoE模型通过锚定监督微调合成工具轨迹,专攻企业级智能体任务,在BFCL Core等基准上表现领先,安全评测亦佳。
突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法 72
Tags:
推理优化大模型基础设施Source:
AI HOT 精选| 阅读原文
[摘要]
LMSYS团队针对DeepSeek-V4-Pro在H20 GPU上做场景化推理优化,单节点达271 tokens/s,将与B300的性能差距缩小至1.42倍,体现低成本部署大模型的潜力。
FastMetal 让 Mac 本地 30 秒生成视频 72
Tags:
开源生态视频生成模型优化苹果芯片Source:
AI HOT 精选| 阅读原文
[摘要]
FastMetal 开源项目将 FastWan-QAD 视频生成模型带到 Apple Silicon,Mac 本地 30 秒生成 5 秒 480P 视频,无需 CUDA 或云端,支持多模型尺寸,降低视频生成硬件门槛。
Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review 72
Tags:
AI安全政策监管学术诚信Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究发现2025年7月18篇arXiv论文通过隐藏文本注入指令操纵AI辅助同行评审,如要求给出正面评价,揭示AI审稿系统安全漏洞及学术诚信风险。
Token Optimization and Context Window Management in Multi-Agent AI Workflows 72
Tags:
智能体推理优化技术论文Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文提出多智能体工作流的token优化与上下文管理框架,含六种模式,生产环境降低60-70% token、冷启动延迟降至61-116秒,并有对照实验验证,对工程实践有参考价值。
Offering Zero Data Retention for frontier models 70
Tags:
公司动态AI安全API数据隐私Source:
OpenAI News| 阅读原文
[摘要]
OpenAI重申符合条件的API客户可享零数据保留,并预览私有安全处理,在保障数据隐私的同时推进高级AI安全,影响企业采用决策。
Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失 70
Tags:
模型发布量化优化开源生态Source:
AI HOT 精选| 阅读原文
[摘要]
Liquid AI 发布基于量化感知蒸馏训练的 LFM2.5 系列 Q4_0 量化检查点,在保持原内存与速度的同时恢复 BF16 精度的 97% 损失,有利于边缘部署。
Replit expands access to software creation with GPT-5.6 Luna 70
Tags:
AI编程产品发布大模型Source:
OpenAI News| 阅读原文
[摘要]
Replit推出免费模式,由GPT-5.6 Luna驱动,用户无需担心代币成本即可将想法转化为可用软件,降低AI编程门槛,值得开发者关注。
Expressivity In Multimodal Contrastive Learning 70
Tags:
多模态对比学习理论研究Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
研究多模态对比学习的表达能力,证明CLIP双子塔结构是通用逼近器,但多模态两两相似度损失无法表达任意联合分布,提出Hadamard-CLIP修复,具理论价值。
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice 70
Tags:
AI安全大模型研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究揭示ChatGPT、Gemini、Grok在金融建议中系统性宗教偏见,仅12-18%建议中立,影响个性化与中立平衡,引发AI伦理关切。