← 全部日期

AI & CV 每日科普 · 2026年7月15日

6 条当日/近期热点 · 工程师向浅科普

【主题】Google再遭出版商起诉,训练数据合规要前置

解读 多家出版商和作者起诉谷歌,称Gemini训练使用了受版权保护的图书和资料。对工程团队来说,这提醒数据来源、授权记录和删除机制不能放到上线后再补。做RAG、微调或合成数据时,也要能说明每一类内容从哪里来、能不能用。

来源 TechCrunch

【主题】NVIDIA GR00T 1.7接入LeRobot,机器人训练链路更统一

解读 NVIDIA把Isaac GR00T 1.7开放到Hugging Face LeRobot,覆盖数据采集、微调和部署。它适合关注具身智能的工程师快速跑通标准流程,而不是从机器人数据格式开始自建工具。落地时仍要重点看硬件适配、演示数据质量和安全边界。

来源 Hugging Face

【主题】LeRobot 0.6强化评测闭环,VLA工程化更近一步

解读 LeRobot 0.6加入更多VLA模型、仿真基准、奖励模型接口和失败后再训练流程。它把机器人项目中常见的采集、评测、纠错和再训练放进同一工具链。团队可以先用仿真和小规模真机验证任务,再决定是否扩大数据采集。

来源 Hugging Face

【主题】LingBot-Vision开源,密集空间感知有新骨干可试

解读 LingBot-Vision是一组自监督ViT视觉骨干,重点放在边界和空间结构上。它对深度估计、语义分割、视频目标分割这类CV任务有参考价值。工程选型时可以先用小模型验证特征质量,再考虑更大的1B级版本。

来源 GitHub

【主题】ZipDepth发布轻量单目深度模型,边缘设备更友好

解读 ZipDepth主打6.1M参数的零样本单目深度估计,目标是在手机、NPU和服务器上都能实时运行。对需要距离感知、AR或机器人前处理的团队,它提供了比大模型更低成本的起点。上线前要按目标摄像头和场景重新测误差。

来源 GitHub

【主题】VultronRetriever开放视觉文档检索模型,文档AI更细分

解读 Vultr发布Flash、Core、Prime三档视觉文档检索模型,面向扫描件、图文PDF和复杂版面搜索。它说明文档AI不只是OCR,还需要把版面、图片和语义一起检索。企业可用小模型先评估召回率,再决定是否接入更重的多模态系统。

来源 Vultr