【主题】PerceptionBench:前沿模型“纯视觉”仍难破60%
解读 Moonshot把多模态评测拆成十类原子视觉技能,尽量不让知识和推理掺进来。结果很扎心:16个前沿模型无一超过60%,第一名大约59.7%。很多看起来像“不会推理”的翻车,其实在读图第一步就错了。对工程师来说,上线VLM前要加二次校验,别把视觉输出当地面真值。
来源 THE DECODER
6 条当日/近期热点 · 工程师向浅科普
解读 Moonshot把多模态评测拆成十类原子视觉技能,尽量不让知识和推理掺进来。结果很扎心:16个前沿模型无一超过60%,第一名大约59.7%。很多看起来像“不会推理”的翻车,其实在读图第一步就错了。对工程师来说,上线VLM前要加二次校验,别把视觉输出当地面真值。
来源 THE DECODER
解读 谷歌把Flash系列又迭代了一版,重点是调试、首通代码和网页生成更稳,同时把导入价压到约每百万输入token 0.75美元。通俗讲:它更适合当流水线里的常驻工人,而不是偶尔出场的天才顾问。选型时可以把难任务留给旗舰,把高频工具调用交给Flash,先算清楚路由和成本。
来源 Google Blog
解读 Lightricks放出LTX-2.5开放权重,并日一接入ComfyUI。宣传点是更快出片、可微调,中小团队在年经常收门槛内商用条款更友好。对做短视频原型的工程师,这意味着可以先在本地把镜头语言跑通,再决定要不要上云API。注意显存门槛和许可证边界,别假设“开源=无限制商用”。
来源 VentureBeat
解读 Liquid AI的新视觉语言模型只有约30亿参数,却强调手机和笔记本上的读屏、物体坐标和函数调用。它不是追求最强推理,而是把“看见界面并动手”做成低时延闭环。做移动助手或桌面RPA的人,可以先测端侧成功率,再决定哪些步骤必须上云端大模型。
来源 MarkTechPost
解读 阿里把Qwen3.8旗舰级MoE权重放到了可下载渠道,总参约2.4T、激活约95B。对想自托管的团队这是大事,但相关报道称其许可证不是简单的Apache,高营收商用可能要另谈。落地清单应写成:分数、显存、上下文、许可证四项一起过,缺一项就别急着上生产。
来源 Hugging Face
解读 DeepMind把机器人能力拆成VLA执行、具身推理和端侧适配几块,强调从脚到指尖的全身控制,以及多机器人协同。对做机器人应用的工程师,这意味着“看懂—规划—动作”可以分层选型,不必一口吃成一个端到端黑盒。现阶段仍以伙伴预览为主,真正量产还要看数据闭环和安全边界。