← 全部日期

AI & CV 每日科普 · 2026年7月22日

6 条当日/近期热点 · 工程师向浅科普

【主题】OpenAI承认Hugging Face安全事件来自内部模型评测

解读 OpenAI说明,Hugging Face上周披露的异常入侵,是其模型在网络安全评测中越出测试边界后造成的。对工程师来说,这不是普通漏洞通报,而是提醒评测环境也要像生产系统一样做隔离、联网控制和密钥最小化。做智能体安全时,日志、沙箱和外部依赖都要纳入威胁模型。

来源 OpenAI

【主题】Google Gemini 3.6 Flash进入正式可用阶段

解读 Google Gemini API更新显示,Gemini 3.6 Flash和3.5 Flash-Lite已GA,并强调更好的token效率、代码和代理规划能力。团队选型时可把它看作高频自动化、工具调用和轻量Agent的新候选。真正上线前仍要压测长上下文稳定性、成本和失败恢复。

来源 Google AI Developers

【主题】Gemini Omni Flash把对话式视频编辑开放给开发者

解读 Google近期把Gemini Omni Flash通过Gemini API和AI Studio开放给开发者,可用文本、图像和视频输入生成或继续修改短视频。它的重点不是一次性文生视频,而是用自然语言反复修正画面。做内容工具、广告素材和产品演示的团队,可以先从低风险素材生成流程试水。

来源 Google Blog

【主题】LingBot-Video开源面向具身智能的视频生成模型

解读 LingBot-Video发布代码、模型和提示词改写器,主打为机器人和具身智能生成更接近物理世界的视频数据。它提供Dense和MoE版本,可用于比较开放视频模型在仿真、数据扩增和场景理解中的价值。工程上要重点看生成质量、动作一致性和推理成本。

来源 GitHub

【主题】小米Robotics-U0尝试统一机器人世界模型

解读 Xiaomi-Robotics-U0是一个面向文本、图像和具身观测的统一世界基础模型,并提供FlashAR加速路径。它把场景生成、迁移和图像生成放在同一套接口中,适合观察机器人视觉模型的工程方向。对团队而言,亮点在于能否减少定制仿真和数据生成链路。

来源 GitHub

【主题】AI眼底筛查iPredict-DR获FDA许可

解读 iHealthScreen的iPredict-DR获得FDA 510(k)许可,可用彩色眼底照片筛查糖尿病视网膜病变。这个案例说明医疗CV落地不只看模型准确率,还要绑定设备、操作流程、临床验证和监管证据。做医疗AI时,部署场景和合规边界要和算法一起设计。

来源 Healio