← 全部日期

AI & CV 每日科普 · 2026年6月2日

6 条当日/近期热点 · 工程师向浅科普

【主题】NVIDIA Cosmos 3 把物理 AI 的生成、推理和动作合到一条链路

解读 Cosmos 3 是一个面向机器人、自动驾驶和仿真的开放 omni-model,能同时处理世界生成、物理推理和动作生成。对工程师来说,重点不是参数更大,而是可以少拼接几个独立模型,直接评估端到端仿真数据和策略生成流程。落地前要看许可证、显存需求、Diffusers 集成和自有数据微调成本。

来源 Hugging Face Blog

【主题】OpenVision 2 用更简单的生成式训练做视觉编码器

解读 OpenVision 2 在 CVPR 2026 展示了一条更轻的视觉编码器路线:去掉文本编码器和对比损失,只保留 caption 生成目标。它的价值在于训练更省显存和时间,适合团队做多模态基座模型的视觉侧预训练实验。实际使用时要注意仓库依赖自带的 open_clip 版本,不能直接拿上游包替换。

来源 GitHub

【主题】Apple 用 VSAS-Bench 测实时视觉助手,不只看答对没有

解读 VSAS-Bench 关注视觉流式助手,也就是模型一边看视频流一边回答和主动提醒。它把评估重点从离线问答扩展到延迟、主动性和多帧稳定性,这更接近监控、车载、AR 和远程协作场景。做 CV 应用时,可以用类似思路设计自己的线上指标,而不是只看单帧准确率。

来源 Apple Machine Learning Research

【主题】MONET 开放大规模图文数据,让文生图研究更容易复现

解读 Jasper Research 发布 MONET,把 29 亿张图片筛到 1.049 亿条高质量图文样本,并配套轻量训练代码。它对小团队的意义是能做可复现的数据清洗、基线模型和内部评测,不必完全依赖封闭数据。商用前仍要审查数据来源、过滤策略和 Apache 2.0 之外的潜在内容风险。

来源 Hugging Face Blog

【主题】JetBrains Mellum2 用小激活参数服务代码和文本场景

解读 Mellum2 是 12B MoE 模型,但每个 token 只激活约 2.5B 参数,目标是更低延迟和更高吞吐。它不是追求所有任务最强,而是适合路由、RAG、摘要、子代理和私有化代码辅助这类高频调用。评估时要用真实并发、上下文长度和业务提示词,因为 MoE 的收益很依赖服务框架。

来源 Hugging Face Blog

【主题】GitHub Copilot 用量计费上线,AI 编程开始更重视成本治理

解读 GitHub 表示 Copilot 用量计费已对用户生效,代码审查还会消耗 Actions 分钟数和 AI Credits。对工程团队来说,这会改变“随便开高端模型”的使用习惯,尤其是代理式任务、长上下文和自动审查。团队应把模型选择、预算告警、权限策略和测试门禁一起设计。

来源 GitHub Changelog