← 全部日期

AI & CV 每日科普 · 2026年6月4日

6 条当日/近期热点 · 工程师向浅科普

【主题】NVIDIA Cosmos 3 把物理 AI 的“看见、想象、行动”合到一个开放模型

解读 Cosmos 3 面向机器人、自动驾驶和工业视觉,把视觉推理、世界生成和动作预测放进同一条链路。对工程师来说,它适合用来做仿真数据、动作条件视频和物理场景验证,不只是做普通视频生成。落地时要重点看显存成本、NVIDIA 生态依赖和模型许可证。

来源 NVIDIA Newsroom

【主题】OpenAI GPT-5.4 强化高分辨率视觉和电脑使用能力

解读 GPT-5.4 支持更高细节的图像输入,并把 computer-use 能力放进 ChatGPT、API 和 Codex。对做 Agent 的团队,这意味着截图理解、UI 点击、技术图解析和自动化测试可以更自然地连接。真正上线前仍要设计权限边界、误操作回滚和人工确认。

来源 OpenAI

【主题】Google Gemma 4 12B 让本地多模态模型更接近可用

解读 Gemma 4 12B 是一个面向本地运行的多模态模型,可处理文本、图像和音频,并提供本地 API server 等开发集成。它的意义是把隐私敏感、离线和低延迟场景从云端模型中分出一部分。工程评估时应先测设备内存、响应速度和多模态输入稳定性。

来源 Google Developers Blog

【主题】GitHub Copilot 接入更多 Gemini 模型,编码工具进入多模型选择期

解读 GitHub 把 Gemini 3.1 Pro 预览版和 Gemini 3.5 Flash 扩展到 Copilot CLI、云端 Agent、Copilot App 和 SDK。对团队来说,这让同一工作流里可以按任务选择不同模型,而不是只押注一个供应商。企业管理员需要同时关注模型策略、费用、数据边界和结果质量。

来源 GitHub Changelog

【主题】Humanoid-GPT 开源把大规模运动数据带进人形机器人控制

解读 Humanoid-GPT 是一个 CVPR 2026 相关开源项目,用 GPT 风格的因果 Transformer 做零样本人形动作跟踪。它把大量动作数据和机器人控制连接起来,适合关注 embodied AI、仿真和视觉动作接口的工程师跟进。当前更适合作为研究和原型参考,上生产还要看硬件适配和安全策略。

来源 GitHub

【主题】Hugging Face 文章提醒 VLM 延迟瓶颈常在视觉 token

解读 这篇文章把视觉语言模型的延迟拆到视觉编码器、视觉 token、缓存和服务引擎层面。工程上很实用,因为许多 VLM 慢不是语言模型本身慢,而是图片预处理和视觉特征重复计算太重。部署多模态应用时,应把图片哈希缓存、前缀缓存和视觉编码器分离纳入压测。

来源 Hugging Face Blog