---
title: "剧组从 200 人砍到 20 人：AI 视频消灭“抽卡”之后，最贵的岗位浮出水面"
id: "20260924A0BULY00"
publicationAccount: "非凡产研"
originalPublishedAt: "2026-09-24T17:02:53+08:00"
canonical: "https://ffcap.cn/research/20260924a0buly00"
source: "https://view.inews.qq.com/a/20260924A0BULY00"
sourceAccount: "https://news.qq.com/omn/author/21759984"
language: "zh-CN"
tags: ["AI 视频","短剧与漫剧","影视动画","AI 编程","AI Agent","模型与基础设施"]
---

# 剧组从 200 人砍到 20 人：AI 视频消灭“抽卡”之后，最贵的岗位浮出水面

文章中的“非凡产研”是原始发布账号署名，不代表已核实个人执笔作者。引用访谈或圆桌观点时，应按正文标明具体发言人及当时身份；无法确认时不要推断。日期为原始发表日期，历史信息以发布时点为准。

AI行业观察

## **剧组从 200 人砍到 20 人：AI 视频消灭“抽卡”之后，最贵的岗位浮出水面**

  

你今天听到的，和你真正做出来的，是两回事。

  

去年，MovieFlow 的系统里还有 20% 的代码是人写的。今年，这个数字变成了零，100% 由 AI 完成。

同一批人，正在把 **200 到 300 人**的传统电影剧组，压缩到 20 人。

这两个数字放在一起，就是 AI 视频行业此刻的真实水位：执行层的活儿，机器吃得比所有人预想的都快。

过去一年，这个行业被反复讨论的问题是“抽卡”。偶然生成一条好片不难，难的是每一次都能稳定生成一条好片。

在非凡资本最近的一场圆桌里，四家从不同方向解决这个问题的公司坐到了一起：做3D和物理可控视频生成的极泛流形、做视频 Agent 平台的 MovieFlow、做漫剧和 AI 视听的极速引擎 Anigo、做工业化批量生产的炫佳科技。

听完整场，我的感受是：“抽卡”这个老大难，正在被工程化快速消灭。但它消灭之后露出来的东西，比抽卡本身更值得琢磨。

  

## **消灭抽卡：四条完全不同的路，都走通了**

角色一致性是抽卡的重灾区。单条视频里角色好不好看，难度不大；难的是第 15 个镜头里的人，和第 2、第 3 个镜头里还是同一个。

四家公司的解法，几乎没有重叠。

炫佳科技 CEO 秦林给的答案最“工科”。他的判断是：只要大模型还在用 Transformer 架构，去噪过程中每次生成的角色就必然有差异，单靠模型侧不可能彻底解决。

所以他们在模型外面套了三层工程约束：输入主角时做样本锚定，生成差异过大就自动重绘；角色主体库和场景主体库双重约束；再拿大量专业摄影和导演术语做提示词工程。

效果可以量化：95% 的机械化生产，剩下 5% 人工调优。他们的 KinoAuto 模块，丢进去一本小说，4 小时后生成一部影片，接近零人工干预。一部 120 分钟的短剧，成本压到 **5000 到 10000 元**，一个人一天就能完成。

![剧组从 200 人砍到 20 人：AI 视频消灭“抽卡”之后，最贵的岗位浮出水面 · 原文图片 1](https://inews.gtimg.com/om_bt/O-R9tvhGKzsCTwf5g2PLAEmQs_omV7z7wyZGd19Y5YSUAAA/1000)

MovieFlow 创始人梁巍的路子完全不同：真人打底。他们原来是做电影的，现在的做法是建一个真人演员库。

物理世界里这个人真实存在，采集得足够清楚，再做加权和训练，之后调用他就跟调用照片和素材一样，基本不会有一致性问题。

这套打法的市场反馈也不错：MovieFlow 上线快一年，全球 150 万用户，覆盖 170 多个国家。

![剧组从 200 人砍到 20 人：AI 视频消灭“抽卡”之后，最贵的岗位浮出水面 · 原文图片 2](https://inews.gtimg.com/om_bt/OKZJWqFSUFgGv0vCJSP6cYqi6bozTMX4eIKmxUlVhmwMEAA/1000)

极泛流形的黄乃元最坦诚。被问到角色一致性怎么解决，他直接说：“还是要交给大模型去提升。”

他们All in的是3D和物理可控的视频生成，就是保持场景背景和物体的一致性，让空间关系和镜头运动更可控，让生成结果更符合物理逻辑。例如，先明确场景结构和机位，再交给视频生成模型执行，从而提高同一场景在不同镜头下的一致性。

![剧组从 200 人砍到 20 人：AI 视频消灭“抽卡”之后，最贵的岗位浮出水面 · 原文图片 3](https://inews.gtimg.com/om_bt/OrK2ZjbiQjrTqZw5YgE8xVV1w0KM_CQnqG6q5cyc5Nzn8AA/1000)

Anigo 的王俊则把宝押在智能体工程化上：把什么任务交给什么样的 Agent，决定了角色稳不稳。

![剧组从 200 人砍到 20 人：AI 视频消灭“抽卡”之后，最贵的岗位浮出水面 · 原文图片 4](https://inews.gtimg.com/om_bt/OfRXnxlDpQrLbpSEM6PDD46l12fgbo9nMLUFS3097ag3kAA/1000)

四条路，原理互不相同，但每条都拿出了能交付的结果。这本身就说明一件事：角色一致性已经从一个技术攻关问题，降级成了一个工程选型问题。选哪条路都行，反正都能到。

  

## **脸不崩只是入门，戏不崩才是难题**

但聊深了会发现，“脸保持一致”只是最容易的那层。

王俊把一致性拆成两层：视觉一致性和叙事一致性。视觉层面，大模型本身的能力已经做得很好。难的在长篇：单次生成有 30 秒上下的边界，超过这个长度，问题就变成了 Agent 之间如何协同，维持角色在叙事层面的连贯。

他举的例子很形象：前一个镜头里角色还非常兴奋，下一个镜头突然变得拘谨。王俊的原话是：“一开始他可能是个疯子。”

梁巍管这个叫表演一致性，话说得更直。

**我们看戏看的是表演，光是脸像其实没有意义。**

一场戏里，角色可能从愤怒到平和，再到愤怒，最后和解。这个状态的流动才是一场戏。纯 AI 要做到这一点，目前确实麻烦。

秦林那边也承认边界。95% 之外的那 5%，集中在极端情况，比如大幅逆光。但他给了一个有意思的对照：现实拍摄里，逆光同样会让面部难以识别。

AI 的短板，有一部分本来就是摄影的短板。

  

## **“镜头再收一点”，收多少？**

镜头控制聊出来的结论，跟技术关系不大。

王俊说，很多人会跟 AI 提“镜头推进一些”这种需求。但什么叫推进一些？真交给执行导演，他一定会把需求追问到非常细：怎么走，走多少。这是个极其模糊的指令。

梁巍把这个话题彻底挑明了。他说，今天把任何一个人放到正式片场，都能坐上导演椅喊“Action”。AI 也一样：你提出需求，喊一声 Action，全剧组几百人开始干活，演员拼命演，摄影机拼命拍。

难的是喊“Cut”。

“你喊了 Cut，全场停下来看你，他们在等另一个结果：这一条到底 OK 不 OK？”

王俊补了一句所有用过 AI 生成的人都会心一笑的话：一般用户只会说，“我感觉不太对，你再想想。”

那到底什么才叫行？梁巍的判断是，大语言模型处理了中间 98% 的工作，但所有人期待的，是最后那个导演判断。

**大语言模型处理了中间 98% 的工作，但所有人期待的，是最后那个导演判断。**

所以工具层没有本质区别：“今天你有 3D 导演台，明天我也能有。”真正的区别在于使用者，让张艺谋来做同一场戏，出来的就不是一回事。

AI 把所有人的底线从 0 分拉到 80 分、90 分，结果导演专业反而更值钱了。

  

## **200 人砍到 20 人，砍掉的全是执行**

剧组从 200 人压缩到 20 人，谁留下了？

梁巍给的清单是：编剧、导演、融合了摄影指导能力的美术指导、懂表演和剧情的表演指导、物理世界里的主要演员，还有剪辑。

剪辑被单列出来讲。短剧、漫剧可以一键剪，因为 2 秒、3 秒、8 秒、10 秒都有相对标准。但电影剪辑没有标准。

蒙太奇可以在某个瞬间“咔嚓”一剪，让你吓一跳；也可以故意一直不剪，让你烦，让你期待后面到底有什么。

**剪辑是第三次创作，AI 目前无法替代。**

秦林从另一个角度给出了同样的结论。他说有两个环节是智能体和模型解决不了的。

第一个是剧本：很多人用 AI 写小说、写剧本，但都触及不了人类情感的灵魂，因为“机器只能从已知导向已知，不能从已知导向未知”，而人最厉害的地方，恰恰是想象未知世界。

第二个是顶级导演对镜头感和美感的把握，审美很难被参数化、被蒸馏。没有人工干预，纯 AI 成片的天花板就是七八十分。

于是未来的协作框架很清晰。梁巍的表述是：人负责最前面的 1%、交付结果后的 1%、提出下一轮要求的 1%；中间每次执行的 98%，交给 AI。

这 20 人剧组减少的，是大量执行性的体力工作。而从事创作、有判断力的人，一个都没走。

  

## **下一个 Vibe Coding，会是视频生成吗？**

聊到这里，还有一道绕不开的判断题：AI 产品的下一个 Vibe Coding，是视频生成吗？

秦林拆过 Vibe Coding 能跑通的原因：代码有规范、有标准、重复频率高。越标准、越高频，越容易商业化。

沿这个逻辑，现阶段 AI 视频真正跑通的单一场景就是短剧，因为短剧恰恰最符合代码的逻辑：公司化、流程化、标准化，创意占比低，是典型的爆米花式内容产品。

他眼里的未来视频分两块。一块是精品电影：好导演加好工具，几百万到 1000 万就能做出原来要几个亿的电影。

另一块是纯工业化生产的短剧、广告、电商、数字人。两块加起来，未来 10 到 15 年，可能是一个 10 万亿级的产业。

黄乃元的提醒更冷静：Vibe Coding 大概率只能解决视频生成里的一小部分问题。做产品要看清楚，哪些事是视频生成基模中短期内不会覆盖的。水位一涨，只做简单加工的产品会先被淹没。

梁巍的答案最锋利，也最像给所有人的建议。第一，不要焦虑技术。今天讨论的一致性、剧组管理工具，一定会有人做好，不需要每个创作者亲自操心。

第二，抓紧入场。技术进步已经远超想象，他们和香港电影人合作的成熟剧集，成片已经完全看不出 AI 痕迹。

他甚至判断，未来可能出现一部“非洲版《甄嬛传》”，背后制作团队全部来自中国，因为全世界 AI 视频制作最强的地方就是中国。

他最后一句话，我想直接用作这篇文章的结尾：

**你今天听到的，和你真正做出来的，是两回事。**

  

## **更多对话细节**

**嘉宾**

极泛流形 COO 兼联合创始人 黄乃元

MovieFlow 创始人 梁巍

极速引擎 Anigo 创始人兼 CEO 王俊

炫佳科技 CEO 秦林

**主持人**

非凡资本 合伙人 王朝超

![剧组从 200 人砍到 20 人：AI 视频消灭“抽卡”之后，最贵的岗位浮出水面 · 原文图片 5](https://inews.gtimg.com/om_bt/OM-IP4WBS0uliOwDvbn1jIp3UX5gTtWEhwymPvys7vFXIAA/1000)

### **开场：四家从不同方向解决“抽卡”的公司**

**王朝超：**过去一年多，大家反复讨论的一个问题，就是如何从偶然生成一条好片，走到每次都能稳定生成一条好片。大家都想减少“抽卡”的损耗，提高成功概率。

今天邀请到的四位嘉宾，都在致力于减少抽卡，让每一次交付都能产出好作品。所以今天的关键词就是“稳定的工作流”。

话不多说，请四位嘉宾分别介绍一下自己。秦总，从您这边开始。

**秦林：**大家好，我叫秦林，我们公司叫炫佳科技。我们从母公司算起，在视频行业已经耕耘接近 30 年，最早的创业团队全部来自清华大学。我们的前身是 1997 年从清华独立出来的清华永新。

从清华分离出来以后，我们独立完成了技术突破，其中一项就是推动视频从模拟电视转向数字电视。在这个过程中，我们于 2007 年在纽交所上市。

上市以后，又分出了二十多家企业，也都紧密围绕视频产业：有做云游戏视频流化的，有做视频网站的，有做直播软件的，也有做机顶盒的。

我们这家公司在南京，一直围绕视频超分、修复、压缩和解码来做。2022 年，我们开始全面投入 AI，也是省内第一批完成自主大模型研发、模型工具和视频工具开发，并打通视频技术底座的企业。

今年是我们走向 AI 的第四年，过程中有很多心得，也踩过很多坑。非常感谢主持人给我这次机会，跟大家分享过程中的心得和收获。谢谢。

**王俊：**很高兴来到非凡，跟大家见面。我是王俊，我们也是一家南京企业，公司叫极速引擎。我们从最开始做动画，到接触所谓的 AI 动画，再到现在做漫剧和 AI 视听，整个产业阶段都经历过。

我们从做内容，到技术驱动内容，再到现在做自己的智能体，也经历了一段时间，几乎什么都碰到过。所以我一直自嘲，前几年是在跟甲方和观众斗智斗勇，最近几年是在跟 AI 斗智斗勇。

我们也希望，未来能在视频产业里，和现在非常卷的大厂一起找到一线生机。

**梁巍：**我是 MovieFlow 的梁巍。我们原来是做电影的，All in AI 是从 2025 年到 2026 年，也就一年多。正好这个月是 MovieFlow.ai 上线快一周年。

现在我们在全球有 150 万用户，覆盖大概 170 多个国家。C 端方面，去年上线时，我们应该是全球第一批视频 Agent；今年已经有一千多个，实在太多了。

我们在全球 C 端市场做得还可以，有画布、工作流、Agent，也有对话式生成。但从今年年中到现在，MovieFlow 更多地开始深度进入专业内容。

因为我原来是做电影的，所以从今年五六月份开始，我们已经深度参与到目前为数不多、还在实拍的重要影视项目中，用 AI 帮助它们降本增效，真正进入实际制作。

另一方面，我们也借助 AI 工具完成新的专业故事创作，重新组建线上的“剧组”。

未来影视环境里会出现两种内容：一种以实拍为主体、AI 为辅助，实拍比例可能从原来的接近 100%，慢慢降到 20% 至 30%，AI 则提高到 70% 至 80%。

另一种是，专业影视工作者和年轻一代影视工作者，把原来影视剧组里的十几个专业分工重新合并、打散。原来一个 200 人的物理剧组，可能变成线上 15 人的剧组。

这支剧组依靠一套专业工作系统，能跨时区、跨地域，甚至跨国家完成专业创作，最终拿出专业作品。这些作品肯定不局限于现在的短剧和漫剧，会更加专业、质量更高。我相信接下来会进入这样一个阶段。

MovieFlow 现在正和专业电影人一起做内容，并在这个过程中构建这套创新的协作系统。这也是我们看向下一阶段的判断：大模型今年开始要进入实际工作，真正交付了。

**王朝超：**所以这是一个从电影转向 All in AI 的团队。好，黄总，您这边。

**黄乃元：**我是极泛流形的黄乃元。我们做的是3D和物理可控的视频生成，主要提供底层技术解决方案。简单来说，我们解决短剧的2个问题：

1\. 精确镜头语言的控制（自由运镜、角色站位等）从而不用反复抽卡 

2\. 同时确保场景、角色（尤其高矮胖瘦）、道具的跨镜头的长程多视角一致性，场景还是可编辑、可布景的。

**王朝超：**四位嘉宾介绍完了。我准备了四个问题，分别关于角色、镜头、工作流和质检。我们先从第一个问题开始，这是一个非常具体、也让创作者很头疼的问题：角色一致性。

单条视频里的角色好不好看，难度没那么大；难的是第 15 个镜头和第二、第三个镜头里仍然是同一个人。行业里目前的解法差异很大，有的用 3D 资产绑定，有的用身份特征锚定，有的用 Agent 约束，也有的干脆把人物做成资产库来管理。

所以我的问题是：在四位各自的产品和技术体系里，角色一致性通过什么技术路径实现？当镜头大幅切换，人物有大幅动作，或者场景光照剧烈变化时，你们的机制边界在哪里？一共两个小问题。先从乃元这边开始。

### **角色一致性：人不变，怎么实现**

**黄乃元：**我们做剧还是小学生，主要提供底层技术。我们的方向是3D和物理可控的视频生成，希望保持场景背景和物体的一致性，让空间关系和镜头运动更可控。比如，在生成前明确场景结构、分镜和运镜，再把这些信息作为约束交给视频生成模型。

**王朝超：**这已经是第二个问题了，还没到镜头，现在说的是角色。

**黄乃元：**对。

**王朝超：**我说的是，人不变怎么实现。

**黄乃元：**如果说的是人物长相的一致性，我觉得仍然需要大模型持续提升。我们更关注场景背景和物体的一致性，以及空间关系和物理逻辑的可控性。

**王朝超：**好，梁总。

**梁巍：**角色一致性其实非常简单。因为我们已经进入实际做片的阶段，用的是物理世界里的演员，所以 MovieFlow 未来会提供一个比较大的演员库，以真人演员为主。

物理世界里有这个人，只要采集得足够清楚，再对人物资产和造型做一定的加权和训练，那么不管是在工作流、画布还是 Agent 创作工具里，基本都不会再有一致性问题。后面就跟调用照片、资产和素材一样。

**王朝超：**就是真人打底。

**梁巍：**对，用稳定的真人素材打底。

**王朝超：**好，王总您这边的答案是什么样的？

**王俊：**我想把“一致性”拆开，从视觉一致性和叙事一致性来聊。视觉层面，不管是 3D 还是 2D，也不管具体用多视图还是其他方式，通过大模型本身的能力，其实已经可以做得很好。除非遇到非常特殊的镜头或运镜，才可能稍差一些，出现幻觉。

比较难的还是长篇，或者视频比较长的时候。单次生成毕竟有时长限制，大模型在 30 秒这里存在边界。超过这个时间，我觉得最难的是 Agent 之间协同，如何维持角色在叙事层面的一致性。

比如前一个镜头里他还非常兴奋，下一个镜头突然变得非常拘谨，这就比较难处理。Agent 之间交互时，需要交代清楚各自的任务。我觉得，这可能比普通用户理解的角色长相一致性更难。

**王朝超：**也就是说，长相一致性问题不大，但角色在不同情绪下的表达一致性更难。

**王俊：**一开始他可能是个疯子。

**梁巍：**老王说的是表演一致性。一个角色从戏的前面演到后面，因为我们看戏看的是表演，光是脸像其实没有意义，演出状态很重要。

要把故事讲下去，他可能从一开始的愤怒到平和，再到愤怒、平和，最后和解。这个过程才是一场戏。如果是纯 AI，这一部分确实有时比较麻烦。

**王朝超：**那王总你们是通过什么样的技术手段去实现？

**王俊：**它可能还是需要做好智能体的工程化，关键是怎么交付信息：把什么任务交给什么样的 AI Agent，这非常重要。比如刚才说的从愤怒到平和，也可能要考虑，这个人的性格是不是就不应该这样做。

**王朝超：**既怕它超纲，又怕它随意涌现，是吧？

**王俊：**对，是的。

**王朝超：**好，秦总。

**秦林：**只要现在的大模型仍然采用 Transformer 架构，人物一致性就不可能单靠模型侧彻底解决。因为在去噪过程中，每次生成出来的角色都会有差异。恰恰因此，在做 Agent 或工具的过程中，工具是非常重要的一环，它可以对大模型做优化。我们从三个路径解决这个问题。

第一，在输入主角时做样本锚定。我们会根据主角的五官比例、面部特征和个体差异，用自研算法约束和锚定主体。在去噪过程中，我们会在检测对抗的 GAN 环节加入约束。如果生成角色与我们锚定的角色差异过大，就让模型重绘，从而避免人工抽卡。

第二，我们提供双主体库：一个是角色主体库，一个是场景主体库。角色库和场景库双重约束，会大幅降低抽卡概率。

第三，我们用提示词工程对智能体流程进行约束。在这个过程中，会大量采用专业摄影和影视导演术语，尽量减少人工介入，让生成面部接近初始输入。但这种情况下也只能做到约 95%，因为一定会有极端情况，比如大幅逆光。

现实拍摄中也会遇到逆光造成面部难以识别；角色或场景快速切换时也可能产生面部扭曲，很难仅靠工程化方法解决。这时就需要人工补足。现在基本能做到 95% 机械化生产，另外 5% 仍需人工调优。

我们有两个单独的模块。一个叫 KinoAuto，只要丢进一本小说，4 个小时后就可以生成一部影片，几乎是零人工干预、零抽卡。另一个是 Plus 2.0 版本，也能以接近零抽卡的方式，用工业化、批量化方式生产内容。

一部 120 分钟的短剧，成本几乎可以压缩到 5000 至 10000 元，一人一天就能完成。这是我们通过工程优化达到的效果。谢谢主持人。

### **镜头控制：什么叫“推进一些”**

**王朝超：**刚才聊了角色。角色稳定下来之后，下一个问题就是：如何让 AI 听懂导演在说什么、导演想要什么？景别、运镜、轴线、节奏，都是视听语言的基本语法。但对模型来说，它更多给出概率性的建议，也就是抽卡，而不是执行确定性指令。

目前行业在镜头控制上主要有两个方向：一种是把分镜做成可预览的中间态，先在 2D 或 3D 空间里锁定静态图或运动图，再交给 AI 把它们连起来做成成片；另一种是多 Agent 协同，让摄影、分镜等不同 Agent 翻译导演意图。

所以我的问题是：在你们各自的实践中，镜头控制最有效的方式是什么？从分镜意图到最终画面，最大的信息损耗发生在哪个环节？你们选择在前端施加更强的约束，还是在后端做更多筛选和修复？黄总，从您这边开始。

**黄乃元：**刚才讲到，我们的方向是3D和物理可控的视频生成。在镜头控制上，可以通过明确场景结构、机位和运动路径，为模型提供更精确的约束，同时保持场景背景和物体的一致性。但这些操作目前仍然比较复杂，对普通用户不够友好。所以我们希望通过Agent和自然语言交互，把这些控制能力变得更容易使用，包括运镜。

前段时间大家应该看到李飞飞博士发布的一个 Demo：可以在场景里从多视角浏览整个场景，也可以做类似“子弹时间”的效果。

我们要把这样的流程做得足够简单、足够 Agent 化。现在，我们可以通过比较自动化的方式，把物体直接摆到场景里的合适位置。不管是人物还是产品，都能放到合适位置。

运镜也可以 Agent 化：你在与 Agent 交流的过程中，它可以自动生成想要的各种运镜。生成后，你只需要做简单微调，比如这里稍微改一下、那里稍微改一下。对大多数普通用户来说，这就比较容易上手。

所以，我们希望把这些控制能力融入更简单的Agent工作流，在保持场景背景和物体一致性的基础上，让用户更容易调整空间关系和镜头运动，做出更符合自己意图、也更符合物理逻辑的视频。

所以我们会 All in 整套 3D 流程，尽量让它足够 Agent 化、足够简单，让大家更容易控制和调用。

**王朝超：**这听起来更像是真人在真实空间里的视觉感受。

**黄乃元：**对，这是其中一种方式。我们整体做的是3D和物理可控的视频生成，既关注场景背景和物体的一致性，也关注空间关系和镜头运动的可控性，让生成结果更符合物理逻辑。

**王朝超：**物理空间不变，镜头放在哪里、怎么用，都不会有太大出入。

**黄乃元：**对，没错，是的，可以这么理解。

**王朝超：**也就是从 3D 空间出发去控制。

**黄乃元：**对，没错，是的。

**王朝超：**好，梁总，你们这边的方案是什么样的？

**梁巍：**其实，“听懂导演语言”这件事，首先你得是个导演，对吧？

**王朝超：**也就是说，你得有审美。

**梁巍：**你也可以直接口述需求。现在不管是大语言模型本身，还是各个工具内嵌的模型，不管是 OpenAI、Claude、Kimi，还是其他模型，都能推演出来。比如你说：“我想拍一场对手戏，我是导演，请给我一套三个人对话戏的分镜。”它都能推演。

我觉得，大语言模型依托各类视频模型和多模态能力，已经具备这种推演能力，也掌握相关知识，所以这本身不是特别难。难的是，你到底想创作什么、想做什么东西。

MovieFlow 为什么下场做专业内容？因为我们发现，即使把工具和平台放到大家面前，一键生成也未必解决问题。

我们刚上线时就做一键生成；今年 1 月已经能一次生成 10 分钟，那时还没有人谈这件事，前两个月大家才开始说能一键生成 10 分钟。包括多 Agent 体系，我们去年九、十月就上线了，只是没有在国内推广。

从我的角度看，导演语言还是要放到具体场景中：你到底要完成什么视频创作需求？

如果做广告、电商或其他展示型内容，我觉得可以直接和 Agent 聊，再找到合适的素材，甚至合适的样板。现在包括我们在内，都有大量一键复刻功能。

你看到一条 YouTube、TikTok 或抖音广告，可以直接复刻；大语言模型帮你拆解它的运镜逻辑和展示逻辑，再换上你的产品，它就成了你的广告。你复刻的是节奏和展示过程。

现在不管是大模型、多模态语言模型还是视频模型，本身都有 Agent 能力。所以模型本身具备导演能力，区别只在于大家如何调用。你只要跟它讲清楚就好。

更重要的是，在具体应用场景里，你是否知道导演要做什么、最终要作出什么决定。

未来，我们会把一些专业影视项目中，专业导演实际创作的过程全面开源。你看上去可能根本感觉不到 AI 参与，但我们会像海外的 Higgsfield 那样，开放大量制作过程。

把一场戏的制作过程开放给用户后，专业导演在创作中沉淀下来的工作能力和交付能力，就能供大家参考和模仿。这比大家在 B 站“拉片”又往前走了一步——你可以直接复刻片子，而其中就包含导演语言。至于最终怎么讲故事，还是取决于你。

所以镜头控制这件事，在 MovieFlow 或其他具备 Agent 能力的平台上，目前都不难。难的是，你首先要确定自己在做导演的工作。

**王朝超：**技术不是问题，好创意、好内容，或者说好的想法，才是核心。主要方式是多聊天，但输出给 AI 的内容，仍然要来自真正好的想法。

**梁巍：**是的。

**王朝超：**好，俊总你们这边。

**王俊：**我认同梁总的意思。很多使用工具的人毕竟不是导演。所以如果问 AI 如何理解、把控或翻译导演意图，前面的定义可能就不成立：那不一定是导演意图。这个前提很重要。

沿着这个问题往后说，大家在使用 Anigo、MovieFlow 这类工具时，要先确定自己需要的是确定性还是不确定性。你希望把多少不确定性交给 AI，又要保留哪些确定性？

比如刚才黄总提到的 3D 机位，我们也可以做；二维分镜也是一样。确定性和不确定性之间要有平衡，而这个平衡会影响人机交互的次数和环节。

所谓全自动化，其实建立在几个问题上：你要什么内容，要多少确定性和不确定性，又想让 AI 承担多少创意。

话说回来，我们也会尝试翻译导演意图。举个简单例子，有人说“推进一些”，到底什么叫推进一些？真交给执行导演，他一定会追问，把需求问得非常细。

**梁巍：**对，什么叫推进一下？最重要的是，他得是个导演。你说镜头再收一些、Close 一些，到底要收多少？

**王俊：**没错，怎么走？这是一个非常模糊的需求。

**王朝超：**这里就有一个问题：AI 或大模型提升得太快，导致导演“平民化”。你们刚才口中提到的导演，指的是专业导演。

**梁巍：**我的理解里，导演有很多层次。今天把任何一个在场的人放到正式片场，大家都可以坐在导演椅上喊“Action”。这很像大家现在使用 AI：你提出一个问题，喊“Action”，所有人就开始做。

但最终你还要喊“Cut”。喊完以后，全场几百人的剧组都看着你，因为他们在等另一个结果：这一条 OK 不 OK？你喊了“Cut”，就得作出决定。AI 也是一样，它帮你做完这件事，等着你说这条到底行不行。

**王朝超：**然后我也不知道。

**梁巍：**如果你不是导演，怎么判断这个镜头？今天的视频模型、大语言模型和 AI，好像把所有人的底线一下拉得很高：原来是零分，现在大家觉得做视频很简单，一下就到 80 分、90 分了。但这并不意味着导演专业不重要，反而更重要。

大语言模型只处理中间 98% 的工作。你坐在片场喊“Action”，全剧组几百人开始干活，演员拼命演，摄影机拼命拍；只要你喊一声“Cut”，全场停下来看你。大模型就是这样，大家期待的是导演判断：这条到底行不行？

**王俊：**一般用户都会说：“我感觉不太对，你再想想。”

**梁巍：**所以，“感觉不行，你再来一条”，那到底什么才叫行？

**王朝超：**瓶颈不在 AI。

**梁巍：**一定在于使用者的专业能力。让张艺谋导演坐在这里，跟王俊、梁巍做同一场戏，结果就不是一回事。所以一切还在使用者。

工具层没有那么难，因为模型能力已经很强，所有人调用的都是模型能力，这一点没有疑问。去年我们做的时候，会强调工具层、应用层的价值。今年应用层当然仍有价值，但更多在于实际工作中沉淀的垂类经验，继续往下深挖。横向的通用能力，大模型已经都有了。

你说 \[原音不清\]、MovieFlow 和 Higgsfield，没有本质区别。今天你有 3D 导演台，明天我也能有。真正的区别在于，使用者到底来做什么。

还要看，如何在垂直场景里让使用过程更接近交付。也就是说，把一个人扔到片场时，给他配一个特别厉害、很有经验的执行导演，站在旁边告诉他：“老板，这条可以过。”有人在他耳边提醒。

我觉得很多做工具、技术和 Agent 的人，应该做到这一层：把你扔到片场时，在旁边放一个非常专业的助手。这样就可以了。但你不可能既不懂导演，也不学习这件事。

**王朝超：**好，秦总，您这边的答案是什么？

**秦林：**因为我是工科生，擅长用工科思维理解世界。AI 带来的是技术平权。什么是技术平权？就是人人都有可能做导演。我们可能做不了 100 分或 120 分的导演，但经过训练，可以做一个 70 分、80 分的导演；再努力一点，也可以做到 90 分。

我们怎么用技术解决这个问题？第一步，我们会做两个智能体：一个是分镜智能体，一个是摄影智能体。它们主要替代导演工作中的一部分专业任务，比如怎么切分镜、怎么选择摄影角度。

前期我们会请大量专业导演，一起训练提示词、修正参数，把很多导演几十年的功力和理解，通过参数和提示词做成模型的后训练。它未必能达到 100 分或 120 分导演的水平，但我们会尽量让它在产出过程中达到入门级甚至更高一级，保证第一步输出接近专业水准。

第二步，在生产过程中，我们先生成低分辨率动图，作为过程解释。不会一次性直接生成成片，而是先生成动图，让更专业的导演判断画面是否符合摄影和影片需要。如果符合，就继续生成；如果不符合，可以进行二次生成。这样能大幅降低算力消耗和返工概率。

第三步是在生成片子之后，加入一个类似剪辑的过程。前期同样会有很多专业摄影师和导演跟我们一起，不断优化和调整参数，保证片子生成时尽可能模拟导演在真实场景里的需要。

现阶段，AI+视频这个行业其实非常年轻。真正算起点，可以从 2024 年 4 月 Sora 第一个版本发布开始，到现在也只有两年多。很多原来不是导演的人也站了出来，做出了非常好的片子。

比如前段时间在国外比较流行的《僵尸清道夫》，创作者是一个没学过摄影、也没学过导演的中专生。技术平权以后，随着技术工程化越来越成熟，再往后推三年、五年，可能有更多环节会被工程化定义。

现在最核心的问题，是我们的工具和模型在理解导演意图时仍有偏差。我描述一段话、导演描述一段话，或者普通人描述一段话，在模型理解中差异很大，所以还需要用后续的多参数不断优化，逐渐逼近我们想要的影片效果。这条路还很长，值得期待。

### **工作流：哪两个环节 AI 解决不了**

**王朝超：**思路跟梁总有点类似：把导演或者厉害的创作者的经验“蒸馏”、数字化，再通过提示词工程先做动图，然后生成成片，对吧？

刚才聊的两个问题，角色和镜头，都属于单点能力。但讨论过程中，大家已经扩散到其他话题。接下来聊工作流。在整个工作流里，哪些环节最难标准化？第二，哪些环节保留着人工随时打断、切入和调整的能力？

**黄乃元：**要不让秦总先来。

**秦林：**好。这个问题和上一个问题其实一样。我们这四年多一直在做模型、工具和智能体开发，也和无数导演交流。到目前为止，有两个环节是智能体和模型解决不了的。

第一是剧本。真正一部影片最核心的灵魂就是剧本。目前有很多人用智能体写小说、写剧本，但我感觉都无法触及人类情感的灵魂。这个环节到目前为止，人工智能还无法完全解决。

现在的编剧和作家会用 AI 辅助，生成一些框架，优化过程中的文字。但真正的主线和情感输入仍来自人。

因为机器和人工智能只能从已知导向已知，不能从已知导向未知；而人类最厉害、无法被超越的地方，是可以想象未知世界，推测我们尚未见过的东西。这是人类思想层面的能力，人工智能短期内很难超越，至少目前还看不到超越的可能。

第二是导演刚才提到的环节。现阶段，仅靠 AI、没有人工干预，能做出的片子大约到 70 分、80 分，这就是目前的极限。未来会怎样不知道，但现在还做不到顶尖导演对镜头感和美感的把握。人类对审美、视觉和镜头的把握，很难用参数、量化和蒸馏来解决。

所以目前还是需要顶级剧本、顶级导演，再加上 AI 工具，才能快速做出更好的 AI 作品。

**王朝超：**谢谢。您的意思是，AI 或大模型能做到七八十分，但人工干预的天花板很高。那么在你们的工作流里，哪些环节允许人工随时介入和打断？

**秦林：**每个环节人工都可以介入。不管是工作流还是画布，我们所有环节都允许人工干预和修正。导演是全程把控的。在影片还没做出来时，导演脑子里已经有一幅完整的画。这就是好导演和普通导演的区别。

**王朝超：**这里有一个问题：从剧本到动图，再到生成成片，整个过程如果随时可以被人工打断，就意味着人必须一直盯着工作流。

**秦林：**如果想做出 100 分或 100 分以上的片子，确实需要这样。要么你干脆不管，全程靠 AI 完成，一点都不介入。

**王朝超：**好，行，俊总。

**王俊：**我换一个思路。现在市面上的 AI 公司大概有两类：一类做内容，一类做电商、跑流量。

**王朝超：**现在还有一种叫“内容电商”。

**王俊：**那也可以，结合起来也没问题。如果纯粹做流量，我觉得每个环节都还好，几乎都不用保留人工；一致性也不需要考虑。但这种情况下，最重要的可能仍然是内容。

比如最早那种小说切片引流视频，具体画面根本不重要，观众最后可能只是放在那里听。我身边有很多人以前真的“看”熊猫头视频，但其实不是看，只是在听。后来我才明白，为什么抖音会有“听抖音”模式。

但如果问哪个环节比较重要，我觉得每个环节都很重要。内容重要，美术设计重要，交付也重要。

我们刚才一直提到“分数”，这个分数到底是你认为的，还是机器认为的？就算由人来评，每个人看同一部片子的感受也不一样。比如前段时间《牛来》单开一桌，有些人觉得还可以，说真的，有人觉得它确实还行，正能量，也表达了一定价值。

但从专业电影人的角度看，可能会觉得方向或表达形式不合适。这是非常主观的事，机器也很难理解我们的意图。所以我觉得，没有哪个环节可以被单独认定为最重要。还是回到刚才的问题：要看如何交互，你想要什么、想确定什么。

我们内部为了提效，更多会在第一次视觉化时介入，比如先看剧照、质量和风格，最后再看成片，这样会更快。现场这些智能体里，我们可能是唯一主要自用的，用它批量交付定制内容。未来目标是开源，但开源之前，先让它有一些收入。

**王朝超：**我们自己先用得顺手，再给大家用。

**王俊：**对，没错。

**王朝超：**梁总，我的问题是：整个工作流里，哪个环节最难标准化？第二，什么环节会保留人工随时打断、介入的能力？

**梁巍：**我这么说吧。我们现在把一个传统电影剧组从 200 到 300 人压缩到 20 人。我讲讲从我的角度看，哪些岗位要保留。

**王朝超：**20 个人，拍一部剧，也不少了。

**梁巍：**剧组从 200 人变成 25 人、20 人以后，编剧要保留，导演要保留；融合了摄影指导能力的美术指导要保留；对表演和剧情有认知的表演指导或 Casting 要保留；还要保留一些主要演员，也就是物理世界里的演员；剪辑同样不可替代。

剪辑师要用音乐、音效和剪辑技巧制造观感、观看体感和视听感受，这一点 AI 无法替代。一键剪辑如果用在电商、投流素材和广告上，就让它一键剪。短剧、漫剧也可以一键剪，因为 2 秒、3 秒、8 秒、10 秒都有相对标准。

但电影剪辑没有标准。蒙太奇可以在你突然看到某一刻时，“咔嚓”一剪，让你吓一跳；也可以故意一直不剪，让你烦、让你期待后面到底有什么。剪辑是第三次创作，目前 AI 无法替代。

即便以后 AI 能做，除非 AGI 到了，每个人都能一键说“为我拍部电影”，但那样我觉得也没意义了。

一个 200 人的剧组缩成 20 人，少了一个数量级，但真正从事创作、有判断力的人仍然在，减少的是大量执行性体力工作。导演、编剧、剪辑，以及重要的美术和摄影指导都还在。

**王朝超：**15 个人，最后可能变成 3 个人。

**梁巍：**其他剧组成员减少了，因为 AI 替代了大量剧组执行工作。问题墙上有人问：“AI 产品的下一个 Vibe Coding 是视频生成吗？”其实是一个意思。

今天代码已经可以由 AI 来写。去年我们 20% 的代码量由 Cursor 完成，今年 MovieFlow 这么复杂的系统，已经 100% 由 AI 写了。剧组也是一样。

人负责最前面的 1%、交付结果后的 1%，以及提出下一轮要求的 1%；中间每次执行的 98% 交给 AI。MovieFlow 的产品功能往前走，也是以这个目的为标准：我们一定要给人留下空间。

我们现在正和专业影视导演一起做 AI 剧集，追求电影级的质感。我们会用真人演员，不会只用纯 AI 演员。纯 AI 演员没有人味，对吧？

而且如果全是纯 AI 演员，我也没法开线下发布会，总得让几个演员坐在这里。要是我们几个人说“现在由我们拍个戏”，线下还能握手，还能多挣一道钱，这件事仍然有意义。所以从我们的角度看，AI 只是压缩了剧组规模。

**王朝超：**好，黄总。我觉得……

**黄乃元：**大部分观点大家已经讲到了。我觉得，好的导演、好的编剧……

**王朝超：**希望从您这里听到一些不一样的声音。

**黄乃元：**如果要把内容进一步细分，我觉得除了电商和短剧，还有一部分内容只是为了满足个人的情绪价值。比如我想自己创作，并不是为了给别人看，只是通过创作满足自己的情绪；作品做出来，我自己看着很开心。

现在抖音或小红书上，有些博主会做非常精致的内容；但也有人发布内容只是为了记录生活，并不追求精致。

不同人的诉求不一样，内容也有很多层次。电商、短剧或漫剧，只是更接近消费场景。但在创作这个场景里，每个人都可以参与。

顶尖导演、编剧和剪辑，确实主要服务于那些需要被大众消费的内容；但对普通人来说，只要 AI 能以尽可能低的成本，帮助他创作出自己想表达的内容，就足够了。

他想拍一个东西，系统应当尽量做到完全可控，不需要抽卡，成本和进入门槛也都尽量低。可能只要像与 AI 对话一样，用自然语言交互，就能创作出来。我觉得这对大多数人也非常有价值。

回到刚才的问题，面向消费的内容仍然需要好剧本、好导演和好剪辑。但对一般内容来说，普通人能借助 AI 或 Agent 真正表达出自己想表达的东西，就是一种很好的方式。

**王朝超：**也就是说，市场需求是多层次的。作品发出去以后，能打中属于你的那一群人就可以，这是一个后验指标。

现场观众也提了很多问题，比如怎么减少 NG、怎么减少每次生成消耗的 Token。我们一直聊的稳定工作流，就是要解决这个问题。过去一两年大家一直在努力，但这件事没有止境。

我们从问题墙里挑一个作为结尾：“AI 产品的下一个 Vibe Coding 是视频生成吗？”黄总先来。

### **下一个 Vibe Coding 是视频生成吗**

**黄乃元：**这个问题很难回答。我不确定提问者的主要目的是什么：是想通过 Vibe Coding 做一个商业产品，并判断视频生成类产品是不是更容易变现吗？

如果是这个意思，我的理解是，Vibe Coding 大概率只能解决视频生成中的一小部分问题。如果只是做一些很简单的内容或加工，视频生成基模能力一提升，水位一涨，产品就可能失去价值。

真正用 Vibe Coding 做产品，要看哪些事情是视频生成基模在中短期内不会覆盖掉的。即使技术继续进步，也不至于一下把你做的事情全部淹没，这样的产品才具有相对长期的价值。

所以不能简单地说，Vibe Coding 就是做一个视频生成产品。要理解视频生成基模在短期和中短期能做什么，以及模型提升后，哪些能力不会被它覆盖。

**王朝超：**这些都是通用问题，但不同人的解题思路和所处背景不一样，所以会给出不同答案、不同维度。好，梁总。

**梁巍：**Vibe Coding 肯定和视频生成属于一大类。而且视频生成才刚开始，还有很大空间。不管是做工具、产品还是内容，都有太多事情可以做。

还有一个问题是：“内容出海，寻找制作团队，有推荐的国家吗？”全世界只有中国是 AI 视频制作最强的，所以就在中国找制作团队，成都、杭州到处都有。

**王朝超：**内容工业化还得看中国。

**梁巍：**这是离火大运。中国第一次可以像好莱坞输出电影制作能力一样，把用 AI 制作内容的能力输出到全世界。放眼全球，也许有一天，非洲观众看到一部“非洲版《甄嬛传》”，背后的制作团队全部来自中国，这很容易成立。我们也没有语言和故事理解的障碍了。

对于爽剧、爽文、网文、游戏和影视的内容节奏，我们并不比好莱坞差，进化速度甚至远远快于他们。现在他们也反过来吸收短剧题材。

最近，好莱坞的导演、编剧和演员工会也开始认可竖屏短剧，允许工会成员参与拍摄。我们已经通过抖音、TikTok 和内容输出，把整套竖屏内容带向全球。未来真的才刚刚开始。

最后我给大家几个建议。第一，不要焦虑技术。技术不是问题，不用担心。今天讨论的一致性、剧组管理工具，一定会有人做好，不需要每个创作者亲自操心。

我们做不好，会有别人做好；大模型、大厂、小厂都可能做好。有人做这个应用层，也有人做另一个应用层。所以第一，不要焦虑技术，技术进步已经远远超过大家的想象。

第二，抓紧入场，做真正对你有意义、有价值的视频内容。做广告，就用它做广告赚钱；也可以做电商，或者做自己喜欢的故事。

接下来的内容市场不会走向全中心化。AI 带来的最大动力之一是去中心化、去权威。所以老王刚才提到《牛来》，对吧？

《牛来》代表的是：2026 年，中国电影第一次开始迎来去他妈的、去精英、去中心化的电影时代。电影院里播的不一定都叫传统意义上的电影。

过去我们理解的电影，好像只有那样的导演、那样的小圈层才能做。但今天、当下和明年，在座各位都有可能制作自己的电影，并在电影院上映。

我相信政策和审查也会推动全民参与，带来文化繁荣。所以不要焦虑技术，早点找到自己喜欢的内容和垂类，快速用 AI 去做。只有真正下场，才知道今天模型的能力。

你今天听到的，和你真正做出来的，是两回事。今天没机会给大家展示，我们正在做的一些片子，已经让人感觉跟 AI 没关系了。

在座各位可能还以为 AI 只能做短剧、漫剧，但我们已经在做成熟的剧集和影像，也在和香港的一些电影人合作，成片完全看不出 AI 痕迹。你也不用关心它是不是 AI。

技术进步很快，普通人也已经能够使用。所以尽快进入 AI 视频创作，早点拥抱它。如果只想当观众，就乐于做观众；如果想当创作者、创业者，或者把它做成一门生意，那就去做。

**王朝超：**AI 产品的下一个 Vibe Coding 时刻，会是视频生成吗？

**王俊：**这个问题让我想起以前和一家 VR 眼镜内容方合作。那时我们还是手工做，AI 都没有，只有 ComfyUI 这类东西，Stable Diffusion 也才刚出来。我们要抠图、贴图、贴到 3D 里，再做 VR 视频，出框、入框之类的效果，实在太费劲。

现在视频生成已经发展得很不错。最近李飞飞他们的世界模型发展很快，那有没有可能接下来进入 VR 时代？那也可以看成视频的一种，或者理解为空间内容，都没问题。按照现在的速度，技术发展确实太快。单纯说“视频产品”，我觉得有点局限，概念可能太窄了。

**王朝超：**对。

**王俊：**比如互动视频，它其实进入的是游戏的框架和概念，不再只是视频。所以如果单纯说视频，我觉得可能稍微窄了一点。

刚才还提到一些其他问题，我也很有感触。比如内容出海，以及美国好莱坞最近也开始与 Seedance 和解。我觉得，这些都是让步和发展。

我们和日本的一些动画老师合作时，也看到一些转变。去年跟他们聊时，日本大部分 IP 和中国不太一样，不在平台手里，可能主要在创作者本人手里。他们很在乎作品的原意，不希望使用 AI 破坏原有语义。

但最近已经出现很强的转变，可能是因为制作速度太慢、手绘太贵，也可能是视频模型本身的发展。中国确实迎来了一个很好的时代，否则也不会提出“出海新三样”——网文、网游、网剧。我觉得这是件挺好的事。

**王朝超：**对，好，秦总。

**秦林：**从 2023 年 GPT-3.5 发布以后，人工智能逐步进入每个人的视野，至今走了四年。这四年里，真正跑通商业模式的主要有两个方向：一个是 Vibe Coding，一个是 AI 视频。

Vibe Coding 解决的核心问题是，代码在很多人眼里是很高大上的职业技能，但对码农来说，它更像传统手工业。它能跑通，最主要的原因是代码有规范、有标准，而且重复频率高。越规范、越标准、重复频率越高，就越可能商业化。

沿着这个逻辑理解，现阶段 AI 视频真正跑通的单一场景主要是短剧，而短剧特别符合代码的基本逻辑。

你可以看到，短剧是公司化、流程化和标准化的，创意相对少，更多像好莱坞电影一样，是典型的爆米花式、刺激荷尔蒙的内容产品。所以它是典型的公司化产物。

短剧能在 AI Video 侧较快跑通，其中一个原因就是它标准化、重复、频次高，能够工业化。主持人刚才问，下一个是不是 AI 视频。

从现在看，未来视频会分成两部分。第一部分是精品电影。随着 AI 到来，会出现越来越多精品，这些精品由大导演加 AI 工具完成，因为 AI 把成本拉低了。原来拍一部电影可能要几个亿，现在不需要。一个好导演加一个好工具，可能用几百万元甚至 1000 万元，就能做出一部好电影。这就是精品电影的时代。

第二部分是纯工业化生产的 AI 视频。短剧、广告、电商和数字人都是方向。这些方向会产生大量标准化、工业化、可复制、可重复的智能体。几乎所有广告也是标准化、套路化、层次化的产品。

从这两个角度看，主持人的判断是对的。下一个一定是“AI+视频”。可以被量化、复制的环节，都适合工业化生产。视频侧一定会被快速催生。在未来可以预见的 10 到 15 年里，它可能成为一个 10 万亿级的产业，也就是最具想象力的产业之一。谢谢。

**王朝超：**我们刚才聊了角色、镜头和工作流。AI 视频是一场双向奔赴：一端是技术流，把各种技术手段、Agent 和模型封装成产品；另一端是导演和内容创作者，从审美、创意出发，追求稳定产出好内容。

技术进步可以帮你做到七八成、七八十分；但要做到高质量、批量化，有好审美，也满足市场需求，还是要靠人的创意。人的创造力没有天花板。

---

原始发布版本：https://view.inews.qq.com/a/20260924A0BULY00

本站阅读页：https://ffcap.cn/research/20260924a0buly00
