← 全部日期

AI & CV 每日科普 · 2026年7月16日

6 条当日/近期热点 · 工程师向浅科普

【主题】Apple Intelligence获准在中国接入Qwen,端侧AI要适配本地规则

解读 苹果的生成式AI服务获准在中国上线,并将把阿里巴巴Qwen接入iOS、iPadOS、macOS和visionOS。对工程师来说,这说明同一套AI功能进入不同市场时,模型、数据流和审核策略都可能要本地化。做跨区域产品时,模型抽象层和合规开关要提前设计。

来源 TechCrunch

【主题】GR00T 1.7接入LeRobot,机器人训练流程更顺手

解读 NVIDIA Isaac GR00T 1.7已经进入Hugging Face LeRobot工作流,覆盖数据集、微调和部署。它把人形机器人项目中分散的采集、训练、评测步骤接到同一套工具里。工程团队可以先用标准命令跑通小任务,再决定是否扩展到真实硬件。

来源 Hugging Face

【主题】Meta新AI芯片计划9月投产,自研算力继续升温

解读 Meta据报将在9月投产新一代MTIA AI芯片,目标是降低部分GPU成本并支撑推荐和AI负载。它不会马上替代英伟达,但能把部分稳定工作负载迁到自家芯片上。对平台团队来说,未来模型部署会更依赖芯片、编译器和服务框架的联合优化。

来源 TechCrunch

【主题】MonkeyOCRv2开源,文档智能更重视文本视觉骨干

解读 MonkeyOCRv2发布了面向OCR和文档理解的视觉基础模型,覆盖多语种解析、公式识别、文档篡改检测和重叠文本分割。它适合先解决“看清文字和版面”的问题,再接大语言模型做理解。做票据、合同、论文解析的团队可以把它作为专项骨干进行评测。

来源 GitHub

【主题】LingBot-Video开源,视频生成开始贴近具身智能

解读 LingBot-Video发布了面向具身智能的视频生成模型,支持文本到视频和图像到视频。它的重点不是普通短视频娱乐,而是生成更接近机器人和物理场景的数据。对CV和机器人团队来说,合成视频可用于方案验证,但仍要用真实数据检查偏差。

来源 GitHub

【主题】SenseNova-Vision统一符号输出和密集预测,视觉任务边界更模糊

解读 SenseNova-Vision发布了模型和数据,既能输出OCR、框、点等符号结果,也能生成分割、深度和法线等密集预测。它体现了视觉模型从单任务工具走向通用视觉接口的趋势。工程选型时要看任务是否真的需要“大一统”,还是小模型组合更便宜。

来源 GitHub