← 全部日期

AI & CV 每日科普 · 2026年7月6日

6 条当日/近期热点 · 工程师向浅科普

【主题】OpenAI 预览 GPT-5.6,模型发布开始带上合规节奏

解读 OpenAI 预览 GPT-5.6 Sol、Terra、Luna 三个模型,先给少量可信伙伴使用,再逐步扩大开放。对工程团队来说,前沿模型选型不只看能力,也要提前确认 API 可用范围、地区限制和安全审查要求。

来源 OpenAI

【主题】Google 把低成本图像和视频生成工具推给开发者

解读 Google 发布 Nano Banana 2 Lite,并把 Gemini Omni Flash 接入 Gemini API 和 AI Studio。它适合先做广告素材、短视频编辑、原型演示等低成本试验,但生产落地仍要关注水印、版权和延迟。

来源 Google Blog

【主题】Baidu Unlimited-OCR 让长文档解析成为开源热点

解读 Unlimited-OCR 主打一次读取多页文档,减少传统 OCR 逐页切分和结果拼接的麻烦。做合同、报告、扫描件入库的团队可以把它作为自托管候选,重点评测表格、版面和中文场景。

来源 GitHub

【主题】VLX-Seek 用区域引用改进小模型视觉定位

解读 VLX-Seek 面向细粒度视觉语言任务,不只是回答图里有什么,还要更准确地指出目标在哪里。对机器人、边缘摄像头和巡检设备来说,这类 3B 级模型路线值得关注,因为它更接近可部署的算力预算。

来源 Hugging Face Blog

【主题】Meta SAM 3.1 加速多目标视频分割与跟踪

解读 SAM 3.1 引入 Object Multiplex,把多个目标放进共享流程里处理,减少多目标视频跟踪的重复计算。做标注工具、视频剪辑和工业检测的团队,可以用它降低交互式分割和跟踪的等待时间。

来源 Meta AI

【主题】GitHub Copilot 视觉与浏览器能力进入工程流程

解读 GitHub 近期把 Copilot 的视觉和浏览器相关能力推进到更常用的开发场景,让代理能结合图片、页面和运行结果理解任务。前端和测试团队可以用它做页面检查、Bug 复现和文档截图分析,但仍要保留人工审批和权限边界。

来源 GitHub Blog