← 全部日期

AI & CV 每日科普 · 2026年6月29日

6 条当日/近期热点 · 工程师向浅科普

【主题】OpenAI 发布 GPT-5.6 Sol/Terra/Luna,但首批仅约20家政府许可伙伴可用

解读 OpenAI 在6月26日正式预览 GPT-5.6 系列,包含旗舰 Sol、均衡版 Terra 和轻量 Luna。应美国政府网络安全审查要求,首批只对约20家获批伙伴开放,公众版预计数周后上线。对工程师来说,这意味着前沿模型发布节奏、API 准入和合规审查正在成为产品选型的硬变量,不能只看 benchmark。

来源 Axios

【主题】谷歌算力短缺拖累 Meta 部分 Gemini 项目进度

解读 报道称 Meta 自3月起使用 Google Gemini 的部分内部 AI 项目因算力供应不足而延期。这说明大模型竞争已从“谁的模型更强”转向“谁能稳定拿到足够 GPU/TPU 配额”。如果你在评估多模型方案,需要把供应商算力 SLA、排队时延和成本上限写进架构设计。

来源 DigitalToday

【主题】Noam Shazeer 离开 Google Gemini 团队加入 OpenAI

解读 Gemini 联合负责人 Noam Shazeer 近期转投 OpenAI,成为又一位从谷歌流向竞争对手的顶级 AI 研究者。对工程团队而言,人才流动往往意味着模型路线、工具链和开源节奏会随之变化。短期可关注 OpenAI 在推理效率和多模态代理上的产品迭代是否加速。

来源 The Verge

【主题】PaddleOCR 3.7.0 继续强化文档解析与多语言 OCR 落地

解读 百度飞桨 PaddleOCR 在6月发布 3.7.0,继续提升文档解析精度、多语言覆盖和 CPU/GPU 推理速度,并提供 tiny/small/medium 三档模型方便边缘部署。对需要把 PDF/扫描件接入 RAG 或知识库的团队,这是值得关注的轻量 OCR 方案,重点看版面还原、表格识别和批量吞吐。

来源 GitHub

【主题】JoyAI-VL-Interaction 开源实时视频语言交互全栈

解读 京东开源 JoyAI-VL-Interaction,提供 8B 级视觉语言模型、对齐训练数据和可部署的实时流媒体交互栈,并支持 vLLM-Omni 部署。它面向“摄像头/直播在场助手”场景,工程上需要重点评估端到端延迟、误触发、长时间运行稳定性和隐私边界。

来源 GitHub

【主题】Meta VLM³ 证明标准 VLM 可直接做 3D 几何任务

解读 Facebook Research 的 VLM³ 展示无需改架构或损失函数,普通视觉语言模型也能在深度估计、像素匹配和相机位姿估计等 3D 任务上接近专用模型。对 CV 工程师来说,这意味着未来可能用同一多模态骨干覆盖 2D 理解与 3D 感知,但落地仍要关注标定、尺度和实时性。

来源 GitHub