Skip to content

2026-08-15

DeepSeek V4 Pro 上线硅基流动,支持1M上下文与多档推理强度,侧重编码、工具调用和智能体工作流,保持MIT开源,定价明确,值得开发者关注。 智谱发布GLM-5.3,基于同基座通过后训练Scaling提升能力,编程性能较前代提升50%,在Terminal Bench 3.0开源第一,并展现网络安全能力,权重两周后开源。 Anthropic宣布未来…

DeepSeek V4 Pro 登陆硅基流动,1M 上下文 85

  • Tags: 模型发布 开源生态 智能体

  • Source: AI HOT 精选 | 阅读原文

[摘要]
DeepSeek V4 Pro 上线硅基流动,支持1M上下文与多档推理强度,侧重编码、工具调用和智能体工作流,保持MIT开源,定价明确,值得开发者关注。


GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力 85

  • Tags: 模型发布 大模型 开源生态 AI安全

  • Source: AI HOT 精选 | 阅读原文

[摘要]
智谱发布GLM-5.3,基于同基座通过后训练Scaling提升能力,编程性能较前代提升50%,在Terminal Bench 3.0开源第一,并展现网络安全能力,权重两周后开源。


Claude 文本水印机制如何运作 78

  • Tags: AI安全 政策监管 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic宣布未来Claude生成文本将嵌入基于DeepMind SynthID-Text技术的水印,用于判定文本是否由Claude生成,以符合欧盟AI法案要求,且不影响输出质量与成本。


The Optimal Sample Complexity of Multiclass and List Learning 76

  • Tags: 机器学习理论 样本复杂度

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
该论文解决多类分类样本复杂度的长期猜想,确定其与DS维度的最优依赖关系,对学习理论有重要理论价值。


How Claude’s text watermark works 75

  • Tags: AI安全 政策监管 Anthropic 模型发布

  • Source: Anthropic News | 阅读原文

[摘要]
Anthropic官方详解Claude文本水印技术:通过低风险随机词选择嵌入可检测模式,不影响输出质量与阅读体验,为满足欧盟AI法案要求而实施。


2026年夏季开源模型生态观察:中国前沿模型规模领先,AMD与NVIDIA主导发布量 72

  • Tags: 开源生态 模型发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
2026年开源模型生态观察:中国实验室前沿模型规模领先(最高达2.78万亿参数),AMD与NVIDIA成为开源模型发布主力,多数模型下载量极少,头部集中效应明显。


When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers 72

  • Tags: AI安全 模型评测 论文

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
该研究提出Groundedness Drift分数,用于黑盒审计语言模型分类器,检测解释掩盖的后门攻击,在多个数据集上优于现有检测器,对AI安全有参考价值。


Unifying Generative Models with Path Integrals 72

  • Tags: 生成模型 理论研究

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
论文提出用路径积分统一生成模型框架,将流模型、扩散模型、VAE和GAN归入同一主作用量,并给出单圈修正,显著降低采样误差,是生成模型理论的重要进展。


FP8 Training on AMD GPUs with TorchTitan and TorchAO: Upstreaming Performance Improvements 72

  • Tags: 训练优化 开源生态 芯片算力 PyTorch

  • Source: PyTorch Blog | 阅读原文

[摘要]
AMD将FP8训练优化上游合并至TorchTitan和TorchAO,原生支持AMD Instinct GPU,性能比肩竞争方案,并展示超1000卡线性扩展能力。


新兴多智能体系统的模式与问题 72

  • Tags: 多智能体 AI安全 研究

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Anthropic研究揭示多智能体系统在共享环境中交互的规模可能超过人机交互,并发现协调智能体更高效但存在系统性失败风险,对AI安全与多智能体设计有重要参考。


Fine-Tuning Generative Models for Extreme Events via CVaR-Penalized Wasserstein Gradient Flows 72

  • Tags: 研究 生成模型 算法 AI安全

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出CVaR-GPA算法,用CVaR惩罚的Wasserstein梯度流微调生成模型,无需预知目标尾部分布即可捕捉重尾极端事件,在合成及金融数据上显著提升尾部准确性。


FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents 72

  • Tags: 数据集 模型评测 金融智能体 基准测试

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新发布FrontierFinance基准,涵盖220个专家问题和11543条评分规则,评估金融智能体全流程能力。当前最优系统仅达56%,且工具框架比模型更关键,开源模型接近专有模型表现,为金融AI评测提供重要参考。


Claim-Level Reliability Assessment for Efficient Test-Time Reasoning 72

  • Tags: 推理优化 研究 测试时扩展

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出无需训练的测试时推理框架CLR,通过声明级证伪重分配计算资源,在多个基准上显著提升推理准确率并降低token消耗,为推理优化提供新思路。


Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL 72

  • Tags: 强化学习 模型训练 AI安全 论文

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Rubric Dropout方法,在基于评分标准的RL训练中随机丢弃部分标准,缓解reward hacking,提升OOD基准表现。


How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment 72

  • Tags: AI安全 多模态 模型评测

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究系统测评中国与国外多模态模型在政治敏感话题上的表现,发现中国模型更多采用改写而非拒绝的隐形审查方式,且中文提示下更明显,揭示AI对齐中人机交互风险。


One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL 72

  • Tags: 强化学习 大模型 研究

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
该研究揭示多智能体强化学习使用单一LLM模拟用户会导致模拟器坍缩,泛化失败,提出推理时Verbalized Sampling和训练时Co-Training两种方案,提升真实用户和未见模拟器上的性能,并开源SCOPE框架。


Locating and Controlling Implicit Personalization in Large Language Models 72

  • Tags: 大模型 AI安全 模型可解释性

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究揭示大模型会因用户隐式人口学线索改变输出,并通过内部激活信号定位与因果干预,提升对隐式个性化的可控性,涉及模型公平与安全。


Gemini 3.7 Flash 全面上线 Pro 与 Ultra 用户 70

  • Tags: 模型发布 产品发布 公司动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
谷歌向 Gemini 聊天 Pro/Ultra 用户推出 3.7 Flash,提升多步任务推理与准确性,Gemini Spark 基于此模型改进 Workspace 工具调用,智能体能力更精准。


The data geometry of masking diffusion: Certified-optimal schedules via unmasking growth complexity 70

  • Tags: 扩散模型 采样优化 理论研究

  • Source: arXiv Statistics - Machine Learning | 阅读原文

[摘要]
提出掩码扩散的路径几何度量UGC,用于优化离散采样调度,理论上可达到恒因子最优误差,并展现维度相关的显著加速。


SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges 70

  • Tags: RAG 多跳推理 模型研究 检索增强

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新研究提出SAG,一种基于SQL查询的动态超边检索增强生成方法,无需离线知识图谱,在HotpotQA等多个多跳问答基准上取得最优结果,为知识密集型智能体检索提供了新思路。