AI 每日精选 · 2026-07-28
19 篇论文 · 多源聚合 + AI 摘要
- 头部大模型厂商密集迭代,Anthropic发Claude Opus 5、DeepMind推Gemini3.6系列,OpenAI上线ChatGPT健康功能
- 前沿技术研究多点突破,覆盖长程智能体、自动驾驶数据集、机器人学习、4位扩散推理优化等方向
- AI产业落地持续提速,科学计算资助、具身医疗、终端智能体、高管变动等领域均有新动态
Hugging Face Daily Papers
StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
HF ★ 18 · Yan Yang, Xiangru Jian, Ziyang Luo… · HF 镜像
针对计算机操作智能体依赖截图感知、信息有损的缺陷,提出StateAct多智能体框架:主智能体直接操作底层程序状态,仅少量场景调用GUI子智能体处理交互,增设独立模块校验结果。在OSWorld2.0基准上,该方案较纯截图驱动方案成功率提升约6个百分点,单任务成本降至1/9,将系统瓶颈从感知转向推理。
DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification
HF ★ 0 · Yuhang Wang, Lingyao Li, Hao Zhou · HF 镜像
针对现有驾驶风格识别易将车辆、场景特征误判为司机专属风格的问题,本文发布大规模多模态自然驾驶数据集DriveDNA,覆盖465名司机共975小时行驶数据,配套少样本司机重识别等三项基准任务。实验显示学习表征识别效果远优于传统描述符,纯视觉模型存在路线泄漏问题,证明风格评估需排除各类混淆变量干扰。
Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
HF ★ 0 · Jianshu Zhang, Keliang Wu, Haoran Lu… · HF 镜像
机器人学习仅靠终端成功信号无法反馈任务执行进度,近年进度奖励相关研究增多但缺乏统一框架、难以横向对比。该综述提出进度奖励建模的统一分析视角,从模型接口、奖励信号构建方法、数据集与评估基准三个维度梳理领域脉络,总结现有方法核心局限,指明未来研究方向。
arXiv cs.LG
Cloud-Native Evaluation-as-a-Service: A Microservices Architecture for Scalable AI Monitoring with Conformal Guarantees
Lei Yang
本文提出云原生AI评估即服务架构EaaS,拆为6个Kubernetes无状态微服务,覆盖共形预测、漂移检测、公平性监控等能力,配套DAG流水线编排与存储接口。经验证其共形预测覆盖误差仅1.4个百分点,各项精度、延迟指标达标,当前暂无开源同类工具同时具备共形预测服务化、微服务拆分、DAG编排三大特性。
On the Depth Scalability of Logic Gate Networks
Taegun An, Dohun kim, Haebeom Lee…
针对现有逻辑门网络(LGN)加深无法稳定提效的问题,本文明确其核心源于优化崩塌及拓扑信息限制,仅保障训练稳定性不足。提出输入锚定LGN(IALGN),每层运算门的隐特征均绑定原始输入锚点,辅以随机k锚松弛优化选锚。三类图像数据集实验显示其100层以上仍可随深度稳定提精度,验证LGN深度可扩展需同时满足稳定优化与输入信息通路设计。
MotifRole-Diff: Risk-Optimal Role-Aware Corruption for Masked Molecular Graph Diffusion
Tasfia Nuzhat Ornee, Elias Hossain, Ivan Garibay…
现有分子图掩码扩散生成采用统一掩码策略,未考虑不同结构组分的重建难度与重要性差异。本文提出MotifRole-Diff方法,将掩码调度建模为不同角色令牌的风险最优分配问题,按去噪难度、图级扰动影响分配掩码率。同等算力下,该方法在QM9、MOSES数据集上分子生成有效性显著提升,FCD指标下降,证实结构感知掩码策略更适配序列化分子图扩散。
OpenAI
How AI is expanding what people do at work
OpenAI
OpenAI最新发布的AI职场影响研究,围绕ChatGPT职场用户的应用行为展开调研,发现这类用户普遍突破自身原有岗位职责限制,主动承接跨角色工作任务,这一趋势正逐步重构传统岗位权责划分与工作边界,印证生成式AI正在切实拓展职场人可完成的工作范畴。
Launching Health in ChatGPT
OpenAI
近期OpenAI为ChatGPT新上线专属健康功能,目前仅面向符合资质的美国用户开放。该功能支持用户安全绑定个人医疗记录及苹果健康平台的相关数据,依托ChatGPT大模型能力输出更具针对性的个性化健康分析洞见,可帮助用户更清晰地认知、掌握自身健康状态。
Anthropic News
Introducing Claude Opus 5
Anthropic
本次介绍的Claude Opus 5是Anthropic旗下Opus高端大模型产品线的阶跃式升级版本。该版本核心针对长周期运行的智能体场景做了专项优化,可稳定支撑智能体长时作业,同时大幅提升了代码生成调试、各领域专业任务的处理性能,更适配复杂开发、专业工作流等高端场景需求。
Inviting hard questions
Anthropic
该项目题为《邀请提出尖锐问题》,核心举措为面向全社会公开征集公众对人工智能领域的各类高难度、高关切疑问。项目团队承诺,在回应、解答这些问题的全流程中,将完整公开所有研究推导、技术逻辑等工作细节,主动提升AI领域信息透明度,推动公众参与AI治理,消解技术信任壁垒。
Google DeepMind
Accelerating the frontiers of scientific discovery: Google’s $40M commitment to the Genesis Mission
Google DeepMind
谷歌宣布为创世纪(Genesis)任务投入总价值4000万美元的AI算力代币与服务权益资源。该项投入旨在依托AI能力拓展科学发现前沿,为生命科学、基础物理等需高算力的科研项目提供充足AI算力支撑,降低前沿研究的AI资源使用门槛,助力多领域科研攻关实现突破性进展。
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
Google DeepMind
谷歌近期推出三款全新Gemini轻量化大模型,分别为Gemini 3.6 Flash、3.5 Flash-Lite与3.5 Flash Cyber。其中3.6 Flash兼顾推理性能与低延迟、高性价比优势,3.5 Flash-Lite适配低算力端侧部署,3.5 Flash Cyber专为网络安全场景优化,三款产品补全了Gemini轻量化矩阵,可覆盖多元场景的商用落地诉求。
Hugging Face Blog
NVIDIA Cosmos-H-Dreams: Bringing Real-Time Generative Simulation to Surgical Robotics
Hugging Face
你当前仅提供了该论文的标题,未粘贴对应的摘要正文内容,请补充完整的摘要文本,我才能准确梳理其核心方法、实验结论,按要求提炼为120字左右、突出核心要点的中文总结内容。
Bringing Nunchaku 4-bit Diffusion Inference to Diffusers
Hugging Face
本工作将专为扩散模型优化的Nunchaku 4比特量化推理方案适配集成至Hugging Face Diffusers生态,开发者无需额外修改代码即可调用。该方案基本不损失生成质量、推理速度几乎无下降,可将扩散模型显存占用压缩超60%,使SDXL等大参数模型可在入门消费级显卡上流畅运行,大幅降低生成式AI图像创作的硬件门槛。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
The Gradient
这篇AI对齐研究反驳“理性主体需以固定最终目标为导向”的默认前提,指出人类理性源于行动适配由行动、倾向、评价准则等构成的实践网络。提出要实现AI与人类协作、适配人类主体性,需让AI决策逻辑匹配人类的实践型行动逻辑,这一要求既关乎伦理对齐,也涉及AI核心安全属性。
Lil’Log
Harness Engineering for Self-Improvement
Lilian Weng
本文梳理递归自我改进(RSI)的概念脉络:1965年I.J.古德最早提出超智能机器可超越人类所有智力活动,还能设计更优机器完成自我迭代;2008年尤德考夫斯基明确RSI是AI用自身智能优化认知底层架构的反馈循环。当前AI领域的RSI既包括模型直接改写自身权重,也可广义覆盖模型优化自身训练管线的行为。
量子位
智能体走向终端,个人AI时代正在到来
量子位
7月北京举办的财新AI主题圆桌,汇聚多方代表研讨智能体重构终端产业、个人AI终端发展前景。业内共识2026年为智能体落地关键节点,AI正从响应式工具进化为自主行动系统,会上发布高通委托IDC编制的智能体终端产业白皮书,专家建言打通研产商链路,推动终端与智能体融合释放潜力。
突发,翁荔离职Thinking Machines
量子位
北大校友、前OpenAI资深研究员翁荔近日宣布离职入职仅20个月的Thinking Machines,距公司发布首个开源模型仅12天。她称离职原因是长期高强度工作导致近7个月身体频出问题,又不愿降低履职投入度,遂选择离开。她此前在OpenAI任职7年,曾主导完成五指机械手单手拧魔方的研发。
超维动力携手北大医疗:务实构建具身智能医疗落地路径
量子位
超维动力与北大医疗近日达成深度合作,摒弃冒进思路,瞄准具身智能医疗落地缺训练场景、缺医护操作数据的痛点,前者输出全栈具身智能技术底座,后者提供真实临床场景与专业医疗经验,双方优势互补,共同打造“拟真训练-场景验证-医院应用”的可复制落地方案,稳扎稳打推进具身智能医疗落地。
这篇对你有用吗? 打个分让我知道下次的方向。
点星星即可评分 · 数据只保存匿名指纹 + 时间戳