【主题】OpenAI 用 Codex 展示“自我改进型”业务 Agent
解读 OpenAI 介绍了 Tax AI 的做法:把生产中的错误、人工复核和评估命令整理成结构化信号,再让 Codex 帮助修复和迭代。对工程团队来说,重点不是让 Agent 自己乱改代码,而是把日志、评审、测试和发布门禁做成闭环。这个模式适合税务、审计、客服和运维等规则复杂、反馈明确的场景。
来源 OpenAI
6 条当日/近期热点 · 工程师向浅科普
解读 OpenAI 介绍了 Tax AI 的做法:把生产中的错误、人工复核和评估命令整理成结构化信号,再让 Codex 帮助修复和迭代。对工程团队来说,重点不是让 Agent 自己乱改代码,而是把日志、评审、测试和发布门禁做成闭环。这个模式适合税务、审计、客服和运维等规则复杂、反馈明确的场景。
来源 OpenAI
解读 Cosmos 3 是面向机器人、自动驾驶和仿真的开源全模态世界模型,能处理文本、图像、视频、音频和动作序列。它的工程意义是减少“视频生成模型、VLM、世界模拟器、策略模型”之间的拼接成本。真正落地时,要重点评估数据许可、推理成本、仿真真实性和下游控制安全。
来源 Hugging Face
解读 Bernini 把视频任务拆成两步:多模态大模型先做语义规划,Diffusion Transformer 再负责视觉渲染。对做视频编辑工具的团队,这种拆法可以让模型更懂“要改哪里、保留哪里”,减少一改就跑偏的问题。短期使用要注意当前开源主要是 Renderer,完整 Planner 能力和硬件门槛还需要继续观察。
来源 量子位
解读 GRN 的更新放出了文本生图和文本生视频的训练、微调代码,主打用全局 refinement 来生成视觉内容。它给工程师的启发是,视觉生成路线不一定只有扩散和自回归两条路。评估时不要只看样例图,还要看训练稳定性、推理速度、控制能力和社区工具链成熟度。
来源 GitHub
解读 Qwen-VLA 基于 Qwen3.5 视觉语言骨干和动作解码器,把机械臂操作、导航和轨迹预测放进统一框架。对机器人团队来说,它更像一个“多任务动作接口”原型,而不是单一平台的专用策略。落地前需要重点验证不同机器人本体、真实传感器噪声和安全约束下的表现。
来源 GitHub
解读 ZipSplat 可以从少量无相机位姿图片中一次前向重建 3D Gaussian 场景,省掉每个场景单独优化的慢步骤。对 CV 和 3D 产品工程师来说,它适合快速做新视角合成、空间内容预览和数据集批处理。真正接入业务时,要测试复杂室内、反光物体、稀疏视角和导出格式。
来源 GitHub