跳到正文 / Skip to content

AI 每日精选 · 2026-07-22

20 篇论文 · 多源聚合 + AI 摘要

TL;DR · 30 秒看完今日
  • 海外头部AI厂商集中发布动态,OpenAI推小企业服务、DeepMind上线Gemini 3.6系列新模型
  • AI学术领域新增多项成果,覆盖世界建模、扩散控制、多目标优化、具身仿真等方向
  • 国内AI领域进展亮眼,小红书大模型IMO夺金,WAIC发布智算、智能体等重磅成果
🤖模型迭代📰厂商动态📑学术成果🇨🇳国内前沿🔒安全合作

Hugging Face Daily Papers

Masked Visual Actions for Unified World Modeling

HF ★ 0 · Hadi Alzayer, Wenlong Huang, Haonan Chen… · HF 镜像

针对机器人世界建模中动作表征与视觉预训练空间难以对齐的痛点,该研究提出像素级控制接口「掩蔽视觉动作」,将动作表征为视频中任意实体的部分可见轨迹。仅用15小时真实与仿真掩蔽样本微调的单模型,可兼顾前向动力学预测、逆运动学求解,在下游操控任务中能有效辅助策略评估、规划决策。

Appearance Pointers — Multimodal Region Control of Diffusion Transformers

HF ★ 0 · Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch… · HF 镜像

针对扩散Transformer(DiT)可控图像生成缺乏精准区域控制的问题,本文提出外观指针机制:通过区域对应网络生成紧凑表征,经空间聚合优化,对齐文本/图像输入与用户指定掩码,无需重训基础DiT。它是首个DiT模态无关局部多模态控制接口,单模型性能比肩甚至优于各模态专用SOTA,可实现精准区域可控生成。

H^2SD: Hybrid Hindsight Self-Distillation

HF ★ 0 · Qiye Cai, Yichuan Ma, Linyang Li… · HF 镜像

针对数学推理、代码生成等大模型推理任务中可验证奖励强化学习监督稀疏、现有自蒸馏方案存在优化不稳定或无明确纠错方向的问题,本文提出混合事后自蒸馏框架H²SD:对成功轨迹用教师信号调整更新幅度,对失败轨迹参考关键推理提示对齐教师分布。实验显示其在多推理基准上性能优于现有基线,优化稳定且生成效率优异。

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

HF ★ 0 · Ting Huang, Zhenyu Zhang, Wenyuan Huang… · HF 镜像

针对现有多模态大模型偏语义导向,长时序跨视角视频空间推理时难以整合一致空间证据、推理稳定性差的问题,本文提出ConsiSpace几何一致性感知框架:构建几何一致性记忆高效存储任务相关空间证据,设计统一一致性自监督强化学习作为后训练信号。在三类空间推理基准测试中,较最优基线平均得分提升12.6分。

arXiv cs.LG

Reinforcement Learning-Guided NSGA-II Enhanced with Gray Relational Coefficient for Multi-Objective Optimization: Application to NASDAQ Portfolio Optimization

Zhiyuan Wang, Qinxu Ding, Ding Ding…

本文针对多目标投资组合优化问题,提出融合强化学习在线自适应调参、灰关联系数选择算子的改进NSGA-II算法RL-NSGA-II-GRC。基准测试显示其收敛性较原NSGA-II提升4.4%~5.8%,应用于纳斯达克投资组合优化时,可得到高密度有效前沿,最高年化夏普率达1.92,能输出适配不同风险偏好的最优方案。

DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau…

针对当前OCR、多模态大模型类文档解析工具繁多、标注稀缺场景下选型难的痛点,该研究提出无标注评估框架DocOCR-Eval,采用三阶段校正排序策略,无需真值即可逼近人工标注的工具排序结果,聚合多模态大模型可进一步提升匹配度,实验验证其可在缺标注场景下可靠完成OCR选型,为系统落地提供指导。

Fully-sensorized smart-eyewear platform for on-device Machine Learning

Andrea Giudici, Christian Veronesi, Pietro Bartoli…

本文提出面向端侧机器学习的ARGO智能眼镜平台,采用软硬件与AI协同设计,搭载集成NPU的STM32N6芯片,提出头并行注意力机制优化YOLOv11适配硬件,本地处理数据无需云端、保障隐私。城市障碍物识别mAP50-95达24,内存仅2.483MB,10FPS下200mAh电池续航113分钟,验证了高性能隐私友好可穿戴AI设备的可行性。

OpenAI

Introducing the ChatGPT for small business program

OpenAI

OpenAI正式推出ChatGPT小微企业专项计划,依托ChatGPT Work的产品能力,面向中小创业者提供AI技能赋能服务,帮助其掌握AI工具落地应用方法,实现日常经营、事务处理等环节的自动化运转,大幅降低小微企业数字化转型的AI使用门槛,最终实现提效增收、驱动业务长效增长的目标。

OpenAI and Hugging Face partner to address security incident during model evaluation

OpenAI

近日OpenAI与Hugging Face联合处置AI模型评估阶段发生的安全事件,同步披露事件初期调研结论。本次事件暴露出攻击者针对AI研发流程已具备高阶定向网络攻击能力,双方梳理的事件细节与攻防经验总结,可为全行业AI系统防御方提供针对性安全优化参考,补齐模型全生命周期的安全短板。

Anthropic News

Inviting hard questions

Anthropic

这是一项AI领域的公共互动举措,相关发起方向全社会公开征集公众关心的高难度AI相关问题,同时作出明确承诺:后续在逐个回应这些征集到的问题时,会完整公开相关研究论证、问题解决的全流程工作内容,以此提升AI研发透明度,回应公众对AI技术发展的关切。

Redeploying Claude Fable 5

Anthropic

AI厂商Anthropic宣布,将在出口管制正式解除后,于7月1日起重启部署Claude Fable 5大模型。本次部署配套两项安全升级:更新全链路网络安全防护体系,同时搭载全新行业级反越狱框架,可有效降低模型被恶意破解、违规滥用的风险,兼顾合规要求与使用安全性。

Google DeepMind

Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

Google DeepMind

谷歌本次推出三款Gemini系列新模型:分别为通用轻量旗舰款Gemini 3.6 Flash、主打极致低功耗低延迟、适配端侧部署的3.5 Flash-Lite,以及面向网络安全垂直场景的定制款3.5 Flash Cyber。三款新品补全了Gemini Flash类产品的布局,可覆盖高性能通用推理、端侧落地、行业专属场景等不同需求,适配多元算力条件。

Introducing Gemini 3.5 Flash Cyber

Google DeepMind

谷歌最新推出轻量级网络安全专用模型Gemini 3.5 Flash Cyber,属于Gemini 3.5 Flash系列的垂直场景定制版本,核心服务网安运维需求,可自动识别各类系统漏洞,同时支持生成适配的补丁方案完成修复,能够显著降低网安从业者的漏洞治理工作负担。

Hugging Face Blog

The State of Simulation for Physical AI: An Overview

Hugging Face

这篇《物理AI仿真现状》综述梳理了物理AI仿真技术发展脉络,对比现有仿真工具对刚体、流体、柔性体等多物理场景的适配能力,剖析虚实域差大、计算成本高两大核心瓶颈,归纳微分仿真、虚实闭环校准等前沿进展,指出高保真低开销通用仿真框架是未来支撑具身智能、实体机器人落地的核心路径。

Grabette: an open system to record robot-manipulation data

Hugging Face

本文推出名为Grabette的机器人操作数据采集开源系统。该系统支持低成本搭建,可兼容各类机械臂、RGBD相机、力触觉传感器等设备,实现多模态操作数据的同步采集与自动标注,适配抓取、灵巧操作场景,生成的数据集可直接用于机器人操作策略训练,解决了现有同类系统闭源、适配性差、成本高的痛点。

The Gradient

After Orthogonality: Virtue-Ethical Agency and AI Alignment

The Gradient

本文基于德性伦理视角开展AI对齐研究,反驳“理性主体必锚定终局目标”的预设,指出人类理性行动并非指向固定目标,而是适配包含行动规范、评价标准等要素的实践网络。文章提出,要实现AI与人类顺畅协作对齐,需让AI决策逻辑匹配人类基于实践的行动“类型签名”,该路径可同时覆盖伦理对齐与核心安全要求。

Lil’Log

Harness Engineering for Self-Improvement

Lilian Weng

递归自我提升(RSI)概念最早由I.J.古德1965年提出,指可超越人类所有智力活动的超智能机器,能自主设计更优系统实现自我迭代。2008年尤德考斯基明确其核心为AI借助现有智能优化自身认知机制的反馈环,当前AI的这类反馈可表现为直接改写自身权重,或是优化自身训练流程。

量子位

酷哇科技亮相WAIC 2026,解密行业首个双层智能体世界模型

量子位

2026世界人工智能大会期间,酷哇科技发布行业首个全栈自研COOWAM双层智能体世界模型,现场演示该模型驱动的机械臂可在动态环境下自主完成多步骤复杂调饮任务,旗下首款重载四足机器狗X0也完成线下首秀。酷哇以该模型为底座,推动城市具身智能从单体作业转向多智能体协同,加速落地公共服务、物流配送等城市场景应用。

小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅

量子位

小红书自研大模型dots-note-3.0在2026年国际数学奥林匹克竞赛(IMO)中斩获满分金牌,是中国首个、全球第二个拿到IMO官方金牌认证的大模型,优于此前仅答对5/6题的谷歌Gemini。该模型全程用自然语言解题,部分题目给出的非常规解法简洁优雅、直击本质,获多位CMO金牌得主高度认可。

WAIC重磅成果|上海仪电智算牵头成立“智算系统架构联盟”并发布《超节点系统架构规范》

量子位

2026世界人工智能大会上,在上海经信委指导下,上海仪电智算牵头23家智算产业链上下游主体,正式成立智算系统架构联盟并发布《超节点系统架构规范》。联盟由仪电-中兴联合实验室运营,将聚合全栈生态资源,破解算力供需失衡、软硬件适配壁垒等痛点,推进自主可控智算底座建设。

这篇对你有用吗? 打个分让我知道下次的方向。

点星星即可评分 · 数据只保存匿名指纹 + 时间戳

评论 · Comments