【主题】Google Gemma 4 12B 把多模态模型带到本地电脑
解读 Google 发布 Gemma 4 12B,主打文本、图像、视频和原生音频输入,并采用无编码器架构。对工程师来说,它的价值在于可以先在本地验证多模态 agent、OCR 或文档理解流程,再决定是否上更贵的云端模型。
来源 Google Blog
6 条当日/近期热点 · 工程师向浅科普
解读 Google 发布 Gemma 4 12B,主打文本、图像、视频和原生音频输入,并采用无编码器架构。对工程师来说,它的价值在于可以先在本地验证多模态 agent、OCR 或文档理解流程,再决定是否上更贵的云端模型。
来源 Google Blog
解读 Meta 推出 Muse Spark 1.1,并开放 Meta Model API 预览。它强调视觉转代码、工具调用和长流程执行,适合做前端原型、看图改 UI、自动化工作流等场景的选型评估。
来源 Meta AI
解读 GitHub 开始把 GPT-5.6 Sol、Terra、Luna 放进 Copilot 模型选择器。团队以后不只是选“最强模型”,还要按任务难度、成本和权限做模型治理,例如复杂重构用高档模型,小修小补用低成本模型。
解读 NVIDIA Isaac Teleop 和 GR00T 1.7 已经接入 Hugging Face LeRobot。机器人团队可以在统一的数据格式里训练、微调和部署 VLA 模型,减少从采集示范到真实机器人测试之间的工程胶水。
解读 LeRobot 新版加入世界模型策略、奖励模型 API、仿真基准和 rollout 工具。它更像一套机器人实验流水线:先让机器人尝试,再收集失败数据,最后继续改模型,适合小团队做可迭代验证。
解读 蚂蚁灵波开源 LingBot-VLA 2.0,覆盖17家机器人厂商、20多种构型,并强调低延迟推理。对具身智能工程师来说,这类模型的重点不是炫参数,而是能否跨本体迁移、快速后训练,并在真实场景稳定执行。
来源 量子位