AI 每日精选 · 2026-07-25
16 篇论文 · 多源聚合 + AI 摘要
- OpenAI上线ChatGPT健康功能,Anthropic发布Claude Opus 5,DeepMind推出Gemini 3系列多款新模型
- 多篇大模型、训练数据、AI对齐方向前沿研究发布,HF推出4比特扩散推理优化方案
- 合肥多模态AI独角兽3个月融资21亿,国产世界模型登顶李飞飞团队榜单并开源
arXiv cs.LG
DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
Hao Liang, Qifeng Cai, Yibo Lin…
针对大模型驱动的训练数据准备缺乏统一评测基准的问题,该研究推出首个下游对齐的统一基准DataPrep-Bench,覆盖6个领域,同步评测数据构造、数据质量评估两类核心能力。配套推出的技能引导数据构造智能体较基线提分近20点;分布对齐评分DAS表现优于现有评估器,是唯一在数学、科学、医疗领域性能相关系数均超0.7的指标。
PhantomFill: When the Form Demands an Answer, Language Models Invent One
Rana Muhammad Usman
本文研究大模型表单填充场景的幻觉问题:对13款模型测试信息不足无法回答的问题,仅调整输出格式,自由文本下模型大多诚实说明情况,强制要求填必填字段时10款模型100%捏造内容,新增“证据不足”选项仅前沿闭源模型能用,抗诱导能力与模型规模不呈正相关。研究发布PhantomFill基准量化捏造率,仅改一行schema即可修复该问题。
The Active Ingredient in Muon’s Grokking
Yufeng Wang
本文拆解Muon优化器模算术领悟速度快于AdamW的核心机制:经多组消融与机理分析,提速核心是牛顿-舒尔茨正交化步骤,而非此前认为的谱范数约束;正交化可得到更低范数泛化解,5次迭代学习率鲁棒性最优,1次迭代更快但易崩溃。研究指出需同步上报领悟首次达标与稳定保持时间,相关代码已开源。
OpenAI
Launching Health in ChatGPT
OpenAI
OpenAI近期为符合资质的美国用户上线ChatGPT健康专属功能:用户可安全绑定个人医疗记录以及苹果健康(Apple Health)平台的健康数据,ChatGPT基于整合后的专属健康信息,可输出更贴合用户实际情况的定制化健康洞察,帮助用户更清晰地认知、管理自身健康状态。
Building AI infrastructure with the Effingham County community
OpenAI
OpenAI正式官宣在佐治亚州埃芬汉县启动“山茶花项目”,联合当地社区共建AI基础设施。该项目明确四项核心承诺:将遵循负责任的能源使用准则,加大对当地的社区公共投入,为本地居民提供适配就业岗位,同时向当地开放Codex大模型使用权限,兼顾产业落地需求与社区实际收益。
Anthropic News
Introducing Claude Opus 5
Anthropic
本次推出的Claude Opus 5是Claude系列高端Opus层级的阶跃式升级产品。其核心能力实现突破性提升,重点强化了长周期运行智能体的底层支撑能力,同时在代码生成、调试等全链路编码类任务,以及各行业专业场景的工作处理效率与准确性上均有明显优化,可更好支撑高复杂度生产级应用需求。
Inviting hard questions
Anthropic
本文是AI相关机构发起的公众征集公告:将面向全社会收集公众对AI领域最关切、最具难度的疑问,同时公开承诺,后续在逐一回应、解答这些问题的全过程中,会完整披露相关研究思路、推导过程等工作内容,主动提升AI相关研究的公开透明度。
Google DeepMind
Accelerating the frontiers of scientific discovery: Google’s $40M commitment to the Genesis Mission
Google DeepMind
谷歌近期宣布投入总价值4000万美元的AI算力代币与云服务权益,支持创世使命(Genesis Mission)项目。这一布局旨在降低前沿科研团队调用高性能AI算力、大模型工具的门槛,依托自身AI技术储备赋能跨学科研究,加快科学成果产出,进一步拓展全球基础研究与技术创新的前沿边界。
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
Google DeepMind
谷歌本次发布三款Gemini系列新模型,分别为Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。三款均归属Flash轻量化产品线,面向不同场景定向优化,可适配端侧低功耗部署、通用高性价比推理、网络安全专项应用等多元需求,完善了Gemini大矩阵,给用户提供更灵活的选型空间。
Hugging Face Blog
Bringing Nunchaku 4-bit Diffusion Inference to Diffusers
Hugging Face
该工作将Nunchaku 4比特扩散模型推理方案集成到Hugging Face Diffusers生态,方法层面优化低位量化压缩策略,解决了4比特推理普遍存在的画质退化问题。落地后无需复杂配置即可调用,相比FP16推理显存占用减半、速度提升20%~30%,生成质量与全精度模型几乎无差异,大幅降低扩散模型部署门槛。
The State of Simulation for Physical AI: An Overview
Hugging Face
这篇物理AI仿真领域综述,系统梳理了当前仿真技术适配物理AI时物理精度不足、跨域泛化性弱、虚实对齐成本高的核心痛点,明确了引擎底层优化、多物理场耦合、虚实迁移校准三大改进方向,指明低功耗高保真、端边云协同仿真架构是未来发展重点,为物理AI在机器人、智能制造等场景落地提供参考。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
The Gradient
这篇AI对齐研究挑战了传统目标导向的智能假设,提出人类理性行动并非锚定终极目标,而是适配由行动、行为倾向、评价标准等构成的实践网络。研究指出,若要AI能配合人类、符合伦理及安全要求,需让AI决策逻辑和人类基于实践的德性行动逻辑匹配,为对齐提供了德性伦理新路径。
Lil’Log
Harness Engineering for Self-Improvement
Lilian Weng
递归自我改进(RSI)最早由学者I.J.古德1965年提出,是可超越人类所有智能活动、能自行设计更优机器的超智能系统的核心属性;2008年尤德考斯基将其明确定义为AI依托现有智能迭代自身认知机制的反馈环。当前AI领域中,该反馈环既包括模型直接改写自身权重,也可广义指模型优化自身训练流程。
量子位
合肥又押中AI独角兽:多模态赛道,3个月融了21亿
量子位
合肥参投的多模态大模型企业智象未来,3个月内完成3轮累计超21亿元融资,最新C轮融资15亿元,估值破10亿美元跻身AI独角兽,获多地国资、产业资本多方跟投,老股东持续加注。当下大语言模型估值红利见顶,资本正转向潜力更大的AI视觉、多模态赛道。
国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源
量子位
兔展智能联合北大、鹏城实验室研发的UniWorld-View登顶李飞飞团队WorldScore世界模型榜。该模型采用三维几何先验结合扩散生成的技术路线,同一套架构可实现单图3D、视频4D任意位姿新视角合成,解决大基线视角生成漂移痛点,位姿控制精准,适配国产昇腾算力,代码权重已全部开源。
菲尔兹奖得主王虹,也发过NeurIPS
量子位
菲尔兹奖得主王虹曾以共同一作身份发表NeurIPS 2019论文,是纯数学跨界AI的典型范例。该工作针对机器学习基础任务低秩矩阵近似的列子集选择算法,突破了此前O(k+1)的近似比上界,按范数p的取值区间给出更紧的误差上界,还为p≥2场景构造了匹配下界,大幅提升了算法的理论严谨性。
这篇对你有用吗? 打个分让我知道下次的方向。
点星星即可评分 · 数据只保存匿名指纹 + 时间戳