AI 每日精选 · 2026-07-20
18 篇论文 · 多源聚合 + AI 摘要
- 海外头部AI厂商OpenAI、Anthropic、DeepMind发布AI治理、模型迭代、落地应用等多项最新动态
- Hugging Face平台公开RecGPT-V3、大模型推理机制、多模态微调等多方向前沿技术成果
- 国内发布量子AI基座“量筹一号”,蚂蚁、阿里云等加入PyTorch基金会推动AI普惠
Hugging Face Daily Papers
RecGPT-V3 Technical Report
HF ★ 14 · Bowen Zheng, Chao Yi, Dian Chen… · HF 镜像
大模型驱动的淘宝RecGPT系列推荐系统前两代落地后暴露三大痛点,RecGPT-V3针对性优化:记忆Hub浓缩用户历史降55.8%建模算力,混合模态模型结合文本与语义ID打通物品匹配,潜在意图推理降200倍输出成本。落地淘宝猜你喜欢后,GMV提升3.97%,端到端服务资源消耗降52.4%,核心交互、交易指标均正向上涨。
From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
HF ★ 12 · Suzhen Zhong, Shayan Noei, Bram Adams… · HF 镜像
针对代码评审人力负担重、AI介入后效质量化证据缺失的问题,研究分析207个GitHub项目的102万条评审PR,覆盖人工主导、LLM辅助、智能体评审三代模式,梳理三类AI引入路径与协作特征。结果显示智能体参与可提升评审效率,但未同步改善质量,人机协作模式是效率核心影响因素,为平衡效质的AI评审机制设计提供实证依据。
xHC: Expanded Hyper-Connections
HF ★ 11 · Xiangdong Zhang, Xiaohan Qin, Sunan Zou… · HF 镜像
针对Transformer超连接(HC)残流扩展此前最多到N=4、继续扩容收益陡降成本激增的瓶颈,本文提出xHC架构:用时序特征增强丰富回写信息,采用稀疏结构仅更新16个并行残流中的4个,配套xHC-Flash降低显存流量。18B MoE模型上xHC较mHC下游得分高4分,同效果计算量低19%,可高效支撑大N残流扩展用于大模型预训练。
Loop the Loopies!
HF ★ 8 · Zitian Gao, Yilong Chen, Yihao Xiao… · HF 镜像
本文推出当前性能最强的循环Transformer架构Loopie,包含两款混合专家(MoE)模型,总参数量20B、6B对应激活参数量仅2B、0.6B。它破解了此前循环Transformer算力提升时扩参效果优于循环迭代的行业痛点,同训练算力下表现远超普通Transformer基线,搭配新型后训练流水线推理能力极强,无工具拿下2025年IMO、IPhO金牌。
Understanding Reasoning from Pretraining to Post-Training
HF ★ 5 · Jingyan Shen, Ang Li, Salman Rahman… · HF 镜像
针对大模型强化学习(RL)后训练与预训练割裂研究的空白,该研究以国际象棋为可控测试床开展全链路实验,辅以数学领域验证:发现预训练损失可预测同算力下RL后性能,预训练token量与RL收益斜率线性正相关;RL不仅放大有监督微调的正确偏好,还能发掘其未覆盖的难任务正确解,规律跨领域通用。
OpenAI
A scorecard for the AI age
OpenAI
《AI时代评分卡》由OpenAI首席财务官萨拉·弗里尔提出,推出了一套可落地的AI价值量化评估工具,围绕有用工作量、单成功任务成本、系统可靠性、算力投资回报率四个维度设定评估标准,可精准测算AI项目的投资回报,为企业评估AI落地商用价值提供了清晰可操作的量化参考。
Why teens deserve access to safe AI
OpenAI
本文围绕青少年安全使用AI的正当需求展开,介绍OpenAI为适配青少年群体使用ChatGPT推出的系列安全优化举措:包括设置年龄适配的内容防护机制、上线专属学习辅助工具、开放家长管控权限端口,同时联合领域专家完善规则,多维度构建青少年AI使用安全体系,为青少年合规使用AI工具提供保障。
Anthropic News
Inviting hard questions
Anthropic
本项目面向公众发起AI硬核问题征集行动:公开收集大众关于AI领域最具困惑性、争议性的疑难问题,同时项目团队作出明确承诺,后续在回应、解答所有征集到的问题时,将全程公开研究推导、验证等全部工作流程,确保过程透明可追溯,消除AI专业研究与公众的信息差。
Redeploying Claude Fable 5
Anthropic
人工智能企业Anthropic宣布,在相关出口管制正式解除后,将于7月1日起重新部署Claude Fable 5大模型。本次上线的版本完成了两项核心安全升级:既更新了全链路网络安全防护机制,还新增了适配产业场景的专用防越狱框架,可有效提升模型开放使用场景下的运行安全性。
Google DeepMind
Our approach to bioresilience
Google DeepMind
谷歌DeepMind与Isomorphic Labs联合公开了双方在生物韧性领域的技术路径与配套AI模型。该成果瞄准生物韧性建设需求,可赋能病原体风险预判、公共卫生应急响应等场景,助力提升应对大流行、生物入侵等突发生物安全事件的抗冲击能力,为全球生物安全防护体系智能化升级提供技术支撑。
Empowering India’s next generation of innovators with ATL Saathi
Google DeepMind
为赋能印度下一代创新人才,谷歌与印度Atal创新使命(AIM)联合推出AI工具ATL Saathi。该工具依托Gemini大模型技术开发,专门服务于印度全国青少年机器人创客实验室的教育工作者,可辅助教师降低科创教学门槛,助力当地青少年科创能力培育,完善本土科创人才早期培养链路。
Hugging Face Blog
Fine-tune video and image models at scale with NVIDIA NeMo Automodel and 🤗 Diffusers
Hugging Face
本方案由NVIDIA联合Hugging Face推出,将NeMo Automodel与Diffusers库相结合,可实现图像、视频生成模型的规模化微调:适配多类扩散类文生图、文生视频模型,优化批量微调任务的算力调度效率,大幅降低相关大模型微调技术门槛,助力开发者快速落地定制化多模态生成应用。
Newer Models, Same Advantage
Hugging Face
本文题为《新模型,旧优势》,聚焦大模型代际迭代与垂直场景选型展开研究。结果显示,尽管新一代大模型通用能力、参数规模持续升级,但在金融风控、医疗小样本诊断等窄域任务中,经领域微调的早期小模型,在精度、推理成本上的优势仍稳定存在,提示垂直场景无需盲目追新,按需选型性价比更高。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
The Gradient
这篇以美德伦理为视角的AI对齐研究,反驳“理性主体需锚定固定最终目标”的传统预设,指出人类理性的核心是依照包含行为、评价标准等要素的实践网络调整行动,提出要实现AI安全合规、与人类顺畅协作,需让AI决策逻辑匹配人类的实践导向推理框架,兼顾伦理对齐与安全要求。
Lil’Log
Harness Engineering for Self-Improvement
Lilian Weng
本文开展面向递归自我改进(RSI)的管控工程研究。RSI概念最早由I.J.古德1965年提出超智能机器设想时衍生,2008年尤德考斯基明确其为AI用自身智能迭代优化认知架构的反馈机制。现代AI落地RSI主要分两类路径:直接改写自身权重,或是优化自身训练管线,为可控自迭代AI研发提供参考。
量子位
WAIC不筹量子重磅发布“量筹一号”——原子量子人工智能基座
量子位
2026世界人工智能大会上,上海不筹量子发布国内首款原子量子人工智能基座“量筹一号”,标志我国量子计算迈入工程化交付与应用验证并行的新阶段。该产品基于团队两项登国际顶刊的原创量子算法,性能优于同类经典方案,得到国际顶尖学术界与全球金融界的权威认可。
蚂蚁集团、阿里云等正式加入PyTorch基金会,携手全球开源力量推动AI普惠
量子位
2026世界人工智能大会期间,蚂蚁集团等正式加入PyTorch基金会,产研各方达成共识:AGI竞争已从单纯模型竞赛转向系统竞争,需依托开源机制联动全产业链,共建开放高效、低成本的AI基础设施,推动AI脱离少数精英工具属性,落地为服务产业的普惠生产力。
冷门的哲学,成了“治”AI的热门
量子位
2024世界人工智能大会上,哲学成为AI领域新晋热点:复旦哲学学者受邀参会分享,新发布的蓝皮书也重点关注AI可信、治理等人文议题。 当前AI能力快速突破,其理解边界、知识可信性等核心问题趋近哲学命题,有学者提出智能需扎根现实世界,依托身体、环境等四要素,为AI发展与治理提供了新思路。
这篇对你有用吗? 打个分让我知道下次的方向。
点星星即可评分 · 数据只保存匿名指纹 + 时间戳