2026-08-02
OpenAI下一代模型Astra以约2000美元成本证明10项数学与理论计算机科学难题,含推翻Connes刚性猜想,附Lean证书,展示AI科研潜力。 DeepSeek 发布开源模型 V4 Flash 0731,MIT 许可,总参数 284B(激活 13B),在 Artificial Analysis 智能指数得分 50,位列开源模型前三,已上线官方 API…
OpenAI Astra 以约2000美元证明10项数学难题 90
Tags:
模型发布AI研究数学推理Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI下一代模型Astra以约2000美元成本证明10项数学与理论计算机科学难题,含推翻Connes刚性猜想,附Lean证书,展示AI科研潜力。
DeepSeek V4 Flash 0731 开源,登顶开源模型前三 82
Tags:
模型发布开源生态大模型Source:
AI HOT 精选| 阅读原文
[摘要]
DeepSeek 发布开源模型 V4 Flash 0731,MIT 许可,总参数 284B(激活 13B),在 Artificial Analysis 智能指数得分 50,位列开源模型前三,已上线官方 API。
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory 78
Tags:
模型研究大模型训练方法Source:
arXiv Computation and Language| 阅读原文
[摘要]
论文提出将参数化长期记忆独立扩展至6.9B参数、300B token预训练,相比单独扩大基础模型更省参数地提升性能,验证了可扩展记忆模块的潜力。
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models 78
Tags:
智能体基准测试模型发布开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
OSReward基准系统评估VLM对计算机使用智能体轨迹的评判可靠性,发现现有模型存在系统性宽松偏差,并发布开源奖励模型OS-Shepherd,以更低成本匹配商业模型,推动CUA评估标准化。
GLM 5.2 助 Hugging Face 抵御秘密模型攻击 75
Tags:
AI安全智能体公司动态模型应用Source:
AI HOT 精选| 阅读原文
[摘要]
Hugging Face遭OpenAI未发布秘密模型发起的全自主Agent网络攻击,四天半内完成17000个攻击动作,GLM 5.2参与防御,凸显AI安全对抗升级。
Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference 75
Tags:
推理优化长上下文模型研究Source:
NVIDIA Technical Blog - Generative AI| 阅读原文
[摘要]
研究提出协同设计AI模型注意力机制,以加速交互式长上下文推理,应对智能体与长上下文工作负载中注意力耗时占比增大的问题。
面壁智能ALIGN:自动对齐智能体与环境接口 75
Tags:
智能体研究大模型Source:
AI HOT 精选| 阅读原文
[摘要]
面壁智能与清华NLP提出ALIGN方法,自动对齐智能体与环境接口,仅改反馈措辞即可显著提升Qwen2.5-7B在ALFWorld的成功率,四个基准最高提升45.67%,并减少65%无效动作。
国家发改委:人工智能相关行业保持 30% 以上高增长,全国智能算力规模达去年同期 2.8 倍 75
Tags:
政策监管芯片算力大模型产业动态Source:
AI HOT 精选| 阅读原文
[摘要]
国家发改委称上半年AI相关行业增长超30%,全国智能算力规模达去年同期2.8倍,首个全国产10万卡集群投用,国产大模型下载量破百亿,体现AI产业高速发展。
国家发改委:将加快《人工智能法》立法进程 75
Tags:
政策监管大模型开源生态Source:
AI HOT 精选| 阅读原文
[摘要]
国家发改委称将加快《人工智能法》立法进程,并披露国产大模型全球下载量超100亿次、万亿参数开源模型已发布,强化风险监测防控,影响AI产业合规方向。
Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models 75
Tags:
研究模型蒸馏推理模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Lightning OPD 2.0,通过交叉拟合风格残差缓解跨教师蒸馏中的风格偏差,在数学推理和代码生成基准上优于此前方法,提升了蒸馏效率。
ORCA-bench: How Ready Are Language Model Agents for Oncall? 75
Tags:
智能体基准评测AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准ORCA-bench评估大模型智能体在真实生产环境中的oncall根因分析能力,结果最佳准确率仅25.3%,凸显前沿智能体在可靠性运维上的显著差距。
TriShield: Zero-Utility-Loss Defense Against Privacy Backdoors in Federated Language Model Fine-Tuning via Orthogonal Gradient Projection and Optimizer State Entanglement 75
Tags:
AI安全隐私保护联邦学习大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出TriShield防御框架,通过正交梯度投影与优化器状态纠缠,在零效用损失下完全抵御NeuroImprint隐私后门攻击,显著提升联邦大模型微调安全性。
Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game 75
Tags:
AI安全智能体评测基准大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准 ParliamentBench 基于“ Secret Hitler ”社交推理游戏,评估16个LLM在欺骗、说服与信息不对称下的推理能力,揭示前沿模型表现强但多数模型难以维持一致欺骗人格。
ChronoMem: Version Control and Semantic Rollback for Large Language Model Agent Memory 75
Tags:
智能体大模型开源生态记忆管理Source:
arXiv Computation and Language| 阅读原文
[摘要]
Google 发布 ChronoMem,为 LLM 智能体长期记忆引入版本控制与语义回滚,支持自然语言撤销历史状态,并配套评估协议,提升多会话记忆可靠性与可纠错性。
Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs 75
Tags:
推理优化模型优化稀疏性Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出Prox框架,利用近似中间通道显著性实现LLM FFN激活稀疏,无需训练,在70%稀疏度下解码速度提升1.99倍,兼容量化和稀疏注意力。
Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution 75
Tags:
AI安全模型压缩智能体Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究发现轻度压缩的LLM能通过困惑度、MMLU和保真度等质量检查,但在智能体执行中会凭空发明操作步骤,且低秩SVD压缩特有,现有安全审查存在盲区,需在部署前增加筛查。
LLM2Vec-Gen: Generative Embeddings from Large Language Models 75
Tags:
模型训练文本嵌入自监督学习开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出LLM2Vec-Gen,一种自监督方法,在冻结LLM参数前提下通过可训练特殊token将模型潜在回复压缩为嵌入,保留输出语义,在MTEB上超越无监督教师8.8%,并提升安全对齐与推理检索能力,代码已开源。
How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data 75
Tags:
数据集合成数据预训练大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
系统研究合成预训练数据生成,发现结构化输出格式优于网页基线,超过1B参数生成器无增益,并发布486B token开源数据集FinePhrase,生成成本降低30倍。
WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning 75
Tags:
推理优化大模型模型压缩Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出WIDE,一种token级动态宽度剪枝框架,通过细粒度动态稀疏和内核协同设计,在50%稀疏度下实现解码最高4.95倍加速,显著提升LLM推理效率。
Scaling medical imaging report generation with multimodal reinforcement learning 75
Tags:
模型发布多模态强化学习医学影像Source:
arXiv Computation and Language| 阅读原文
[摘要]
微软发布UniRG框架,用多模态强化学习生成医学影像报告,新模型UniRG-CXR在ReXrank基准上大幅刷新SOTA,展现了跨机构泛化能力。