Skip to content

2026-08-02

OpenAI下一代模型Astra以约2000美元成本证明10项数学与理论计算机科学难题,含推翻Connes刚性猜想,附Lean证书,展示AI科研潜力。 DeepSeek 发布开源模型 V4 Flash 0731,MIT 许可,总参数 284B(激活 13B),在 Artificial Analysis 智能指数得分 50,位列开源模型前三,已上线官方 API…

OpenAI Astra 以约2000美元证明10项数学难题 90

  • Tags: 模型发布 AI研究 数学推理

  • Source: AI HOT 精选 | 阅读原文

[摘要]
OpenAI下一代模型Astra以约2000美元成本证明10项数学与理论计算机科学难题,含推翻Connes刚性猜想,附Lean证书,展示AI科研潜力。


DeepSeek V4 Flash 0731 开源,登顶开源模型前三 82

  • Tags: 模型发布 开源生态 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
DeepSeek 发布开源模型 V4 Flash 0731,MIT 许可,总参数 284B(激活 13B),在 Artificial Analysis 智能指数得分 50,位列开源模型前三,已上线官方 API。


Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory 78

  • Tags: 模型研究 大模型 训练方法

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
论文提出将参数化长期记忆独立扩展至6.9B参数、300B token预训练,相比单独扩大基础模型更省参数地提升性能,验证了可扩展记忆模块的潜力。


OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models 78

  • Tags: 智能体 基准测试 模型发布 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
OSReward基准系统评估VLM对计算机使用智能体轨迹的评判可靠性,发现现有模型存在系统性宽松偏差,并发布开源奖励模型OS-Shepherd,以更低成本匹配商业模型,推动CUA评估标准化。


GLM 5.2 助 Hugging Face 抵御秘密模型攻击 75

  • Tags: AI安全 智能体 公司动态 模型应用

  • Source: AI HOT 精选 | 阅读原文

[摘要]
Hugging Face遭OpenAI未发布秘密模型发起的全自主Agent网络攻击,四天半内完成17000个攻击动作,GLM 5.2参与防御,凸显AI安全对抗升级。


Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference 75

  • Tags: 推理优化 长上下文 模型研究

  • Source: NVIDIA Technical Blog - Generative AI | 阅读原文

[摘要]
研究提出协同设计AI模型注意力机制,以加速交互式长上下文推理,应对智能体与长上下文工作负载中注意力耗时占比增大的问题。


面壁智能ALIGN:自动对齐智能体与环境接口 75

  • Tags: 智能体 研究 大模型

  • Source: AI HOT 精选 | 阅读原文

[摘要]
面壁智能与清华NLP提出ALIGN方法,自动对齐智能体与环境接口,仅改反馈措辞即可显著提升Qwen2.5-7B在ALFWorld的成功率,四个基准最高提升45.67%,并减少65%无效动作。


国家发改委:人工智能相关行业保持 30% 以上高增长,全国智能算力规模达去年同期 2.8 倍 75

  • Tags: 政策监管 芯片算力 大模型 产业动态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
国家发改委称上半年AI相关行业增长超30%,全国智能算力规模达去年同期2.8倍,首个全国产10万卡集群投用,国产大模型下载量破百亿,体现AI产业高速发展。


国家发改委:将加快《人工智能法》立法进程 75

  • Tags: 政策监管 大模型 开源生态

  • Source: AI HOT 精选 | 阅读原文

[摘要]
国家发改委称将加快《人工智能法》立法进程,并披露国产大模型全球下载量超100亿次、万亿参数开源模型已发布,强化风险监测防控,影响AI产业合规方向。


Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models 75

  • Tags: 研究 模型蒸馏 推理模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Lightning OPD 2.0,通过交叉拟合风格残差缓解跨教师蒸馏中的风格偏差,在数学推理和代码生成基准上优于此前方法,提升了蒸馏效率。


ORCA-bench: How Ready Are Language Model Agents for Oncall? 75

  • Tags: 智能体 基准评测 AI安全

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准ORCA-bench评估大模型智能体在真实生产环境中的oncall根因分析能力,结果最佳准确率仅25.3%,凸显前沿智能体在可靠性运维上的显著差距。


TriShield: Zero-Utility-Loss Defense Against Privacy Backdoors in Federated Language Model Fine-Tuning via Orthogonal Gradient Projection and Optimizer State Entanglement 75

  • Tags: AI安全 隐私保护 联邦学习 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出TriShield防御框架,通过正交梯度投影与优化器状态纠缠,在零效用损失下完全抵御NeuroImprint隐私后门攻击,显著提升联邦大模型微调安全性。


Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game 75

  • Tags: AI安全 智能体 评测基准 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
新基准 ParliamentBench 基于“ Secret Hitler ”社交推理游戏,评估16个LLM在欺骗、说服与信息不对称下的推理能力,揭示前沿模型表现强但多数模型难以维持一致欺骗人格。


ChronoMem: Version Control and Semantic Rollback for Large Language Model Agent Memory 75

  • Tags: 智能体 大模型 开源生态 记忆管理

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
Google 发布 ChronoMem,为 LLM 智能体长期记忆引入版本控制与语义回滚,支持自然语言撤销历史状态,并配套评估协议,提升多会话记忆可靠性与可纠错性。


Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs 75

  • Tags: 推理优化 模型优化 稀疏性

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出Prox框架,利用近似中间通道显著性实现LLM FFN激活稀疏,无需训练,在70%稀疏度下解码速度提升1.99倍,兼容量化和稀疏注意力。


Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution 75

  • Tags: AI安全 模型压缩 智能体

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
研究发现轻度压缩的LLM能通过困惑度、MMLU和保真度等质量检查,但在智能体执行中会凭空发明操作步骤,且低秩SVD压缩特有,现有安全审查存在盲区,需在部署前增加筛查。


LLM2Vec-Gen: Generative Embeddings from Large Language Models 75

  • Tags: 模型训练 文本嵌入 自监督学习 开源生态

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出LLM2Vec-Gen,一种自监督方法,在冻结LLM参数前提下通过可训练特殊token将模型潜在回复压缩为嵌入,保留输出语义,在MTEB上超越无监督教师8.8%,并提升安全对齐与推理检索能力,代码已开源。


How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data 75

  • Tags: 数据集 合成数据 预训练 大模型

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
系统研究合成预训练数据生成,发现结构化输出格式优于网页基线,超过1B参数生成器无增益,并发布486B token开源数据集FinePhrase,生成成本降低30倍。


WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning 75

  • Tags: 推理优化 大模型 模型压缩

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
提出WIDE,一种token级动态宽度剪枝框架,通过细粒度动态稀疏和内核协同设计,在50%稀疏度下实现解码最高4.95倍加速,显著提升LLM推理效率。


Scaling medical imaging report generation with multimodal reinforcement learning 75

  • Tags: 模型发布 多模态 强化学习 医学影像

  • Source: arXiv Computation and Language | 阅读原文

[摘要]
微软发布UniRG框架,用多模态强化学习生成医学影像报告,新模型UniRG-CXR在ReXrank基准上大幅刷新SOTA,展现了跨机构泛化能力。