← 全部日期

AI & CV 每日科普 · 2026年6月13日

6 条当日/近期热点 · 工程师向浅科普

【主题】MiniMax M3 把百万级上下文带进开源多模态模型

解读 MiniMax M3 是一个约 4280 亿参数的 MoE 模型,每次推理激活约 230 亿参数,并支持文本、图像和视频输入。它用稀疏注意力把上下文扩到 100 万 token,目标是让长代码库、长视频和长任务记忆更容易落地。工程师评估时应重点看显存、推理延迟、长上下文检索质量和许可证边界。

来源 Hugging Face

【主题】Perceptron Mk1 专攻视频理解和具身推理

解读 Perceptron Mk1 是面向图像、视频和物理世界任务的视觉语言模型,强调从长视频中找事件、给时间点和理解多摄像头场景。它适合仓储、机器人、质检和现场运维这类需要“看过程”的产品原型。落地时要关注视频抽帧策略、API 成本、失败回退和人工复核入口。

来源 Perceptron

【主题】NVIDIA Cosmos 3 继续押注物理 AI 世界模型

解读 NVIDIA Cosmos 3 面向机器人、自动驾驶和仿真数据生成,把视觉推理、世界生成和动作预测放进同一套物理 AI 模型。它的意义不只是做视频生成,而是帮助团队生成训练数据、测试边界场景和构建策略模型。工程上可以把它看作仿真、合成数据和边缘推理链路的一部分。

来源 NVIDIA Newsroom

【主题】微软 MAI-Code-1-Flash 让 Copilot 多一个快模型

解读 微软把 MAI-Code-1-Flash 接入 GitHub Copilot 和 VS Code,主打日常编码请求的速度和成本。它说明编程助手不一定每次都需要最大模型,简单补全、局部修改和小范围解释可以交给更轻的专用模型。团队做 AI 编程工具选型时,可以按任务复杂度做模型路由。

来源 Microsoft AI

【主题】Roboflow 用检测模型加多模态模型搭视觉 Agent

解读 Roboflow 的教程把视觉 Agent 拆成两层:检测模型先快速找出目标,多模态模型再根据结构化结果做判断。这个模式适合库存、工厂、零售和安全巡检,因为输出更稳定,也更容易监控。对工程师来说,先把检测、规则、通知和人工确认打通,通常比直接训练大模型更现实。

来源 Roboflow Blog

【主题】Nex-N2 开源 Agent 模型强调长流程闭环

解读 Nex-N2 面向真实生产力任务,把需求理解、计划、工具调用、执行反馈和调试放进一个 Agentic Thinking 流程。它提供 Pro 和 mini 两个版本,方便团队在能力、延迟和成本之间取舍。自部署评估时要重点测仓库理解、终端安全、长任务恢复和工具权限控制。

来源 GitHub