面向视频生成模型的多模态训练数据集构建
面向视频生成模型的训练与评测需求,开展规模化多模态数据构建,覆盖数据圈选、数据清洗、样本解析与配对、算子处理、VLM 辅助内容理解、质量过滤及数据集交付。
我的职业实践始于 3D 动画、电影视效及 Pipeline 开发,加入字节跳动前拥有 8 年动画与电影视效行业经验。2020 年加入字节跳动后,技术方向逐步从传统视觉内容生产拓展至云端制作与渲染基础设施、PCG 驱动的渲染合成数据、多模态数据工程及生成式 AI 应用。
我目前就职于字节跳动智能创作团队,专注于视觉内容生产、视频生成应用与数据工程,工作涵盖渲染合成数据生产、多模态训练与评测数据集构建、模型工作流开发及业务落地,并持续关注空间智能与世界模型方向。
面向视频生成模型的训练与评测需求,开展规模化多模态数据构建,覆盖数据圈选、数据清洗、样本解析与配对、算子处理、VLM 辅助内容理解、质量过滤及数据集交付。
设计面向动作迁移的渲染数据集,构建跨多种动作、身份与环境且时间对齐的多视角视频,为时空迁移研究提供训练数据支持。
持续推动渲染平台基础设施建设,生产面向视频 LoRA 训练的可控渲染合成数据,支持多款 AI 视频特效上线。
基于 ComfyUI 工具链支持下游图像与视频生成应用,包括 I2VControl 与身份保持工作流插件开发、开源模型适配、内部模型集成及工作流部署。
在字节跳动,工作方向从渲染平台基础设施和基于 Houdini 的程序化数据生成,逐步延伸至面向视频生成模型的多模态数据工程。早期工作支持 3D 动画生产、3D GAN、AIGC 应用及视频 LoRA 训练;近期聚焦 VLM 辅助的数据清洗、样本配对、质量过滤与数据集交付。
负责《封神三部曲》项目 Pipeline 架构与生产基础设施建设,基于 ShotGrid 定制制作流程及资产、镜头与任务数据管理,建立覆盖数据入库、校验、追踪、发布与交付的生产闭环,以及北京、青岛与洛杉矶多地制作团队间稳定、可追踪的自动化文件传输与同步机制。
在《长城》《美国队长 3》等 10 余部好莱坞及华语电影项目中,参与建设统一、可扩展的工作室级通用 Pipeline,构建基于生产上下文的 DCC 工作流,支持资产与镜头跨制作环节的版本迭代与依赖管理;根据项目需求开展 Pipeline 适配,推动制作团队向新体系迁移,保障多项目稳定生产。
参与动画剧集《三国演义》的 3D 动画制作,负责 Maya 制作工具与文件质检流程建设、场景清理优化及 Deadline 渲染农场运维,为建模、Layout、动画、灯光和渲染等环节提供 Pipeline 技术支持,保障制作数据质量与渲染任务稳定运行。