← 全部日期

AI & CV 每日科普 · 2026年6月18日

6 条当日/近期热点 · 工程师向浅科普

【主题】Gemma 4 QAT 把端侧大模型部署继续往前推

解读 Google 给 Gemma 4 发布量化感知训练检查点,重点是降低手机、笔记本和消费级 GPU 上的内存占用。对工程师来说,这类模型更适合先做本地原型验证,比如离线助手、端侧图片理解和隐私敏感任务。选型时不要只看模型大小,还要测延迟、内存峰值、运行时支持和量化后的回答质量。

来源 Google Blog

【主题】Serge 展示了开源 AI 代码审查的产品形态

解读 Hugging Face 推出 Serge,一个接入 GitHub PR 流程的开源 AI 代码审查工具。它的关键点不是替代人类 reviewer,而是把仓库规则、模型选择和评论发布放进标准协作流程里。团队可以用它学习如何设计权限、提示词规则、审查范围和模型可替换接口。

来源 Hugging Face Blog

【主题】PaddleOCR v3.7 说明传统 OCR 仍有很强工程价值

解读 PaddleOCR v3.7.0 发布 PP-OCRv6,强调 50 种语言统一模型、工业字符增强和更快推理。很多票据、表单、屏幕和产线文字任务不一定要直接上大型 VLM,先用稳定 OCR 做结构化更省钱也更可控。后续可以把 OCR 结果交给 LLM 做理解、校验和流程自动化。

来源 GitHub

【主题】腾讯 Hy-Embodied-0.5-VLA 把视觉语言动作模型推向机器人落地

解读 腾讯混元开源 Hy-Embodied-0.5-VLA,包含代码、模型和 2000 多小时第一视角操作数据。它面向机器人操作,把视觉、语言和动作放进一套端到端系统中。工程团队评估这类 VLA 时,要重点看数据采集成本、硬件适配、任务成功率和失败保护,而不是只看演示视频。

来源 GitHub

【主题】Qwen-RobotManip 强调机器人数据对齐比单纯堆模型更重要

解读 阿里云社区介绍 Qwen-RobotManip,用 Qwen-VL 作为基础,并把人类演示视频转换成多种机器人形态的数据。它说明机器人 foundation model 的难点常在数据对齐、动作表示和跨硬件迁移。做真实项目时,可以先关注单一场景的稳定闭环,再逐步扩展到多任务和多设备。

来源 Alibaba Cloud Community

【主题】中国 AI 芯片替代开始进入训练流程细节

解读 南华早报梳理了多个使用国产芯片的中国 AI 模型,重点不只是推理替代,而是训练和后训练环节能否迁移。对工程师来说,芯片替代会牵动框架适配、算子覆盖、通信效率和调参经验。评估国产算力时,需要把模型效果、开发效率和供应稳定性一起算账。

来源 South China Morning Post