跳到正文
非凡资本

研究与观点 / UNIQUERESEARCH

Sora2和nano banana Pro之后创作的门槛塌了,上限却被拉爆了

如果说过去一百年,影像的门票一直握在少数人手里,那 2025 年开始,这张门票正在被重新打印,而且是按每个人一份的规模印。

在北京2025非凡大赏的这场 Panel上,讨论的主题很直白:AI 时代的创造者会是谁?视频大模型会把内容产业推向哪里?

坐在台上的四位嘉宾,刚好代表了这股浪潮最硬的四条支流:

智谱高级副总裁Richard 吴玮杰,爱诗科技B端负责人 孙伟哲,生数科技/Vidu 副总裁 王川,以及 Sand.ai Chris 苏果立;主持人是非凡资本合伙人 赵亮。

他们不是在聊趋势,而是在掰开给你看:当 Sora 2 把视频模型的能力抬到新高度之后,创作这件事,究竟会从专业工厂,滑向每个人的日常?

Sora2和nano banana Pro之后创作的门槛塌了,上限却被拉爆了 · 原文图片 1

一. 四个Aha Moment,其实指向同一件事

主持人赵亮的问题很直接:你们什么时候被 AI 戳中,从此就下了场?

Chris说的不是某个炫技 demo,而是 GPT-4o 的一个更深层的启发:

模型正在从工具箱变成内建能力。

过去做产品像搭积木:语言模型、图像模型、工作流、插件,一块块拼起来。GPT-4o 的生图给他的震撼是:那些原本要靠工作流串起来的复杂操作,被折叠进了模型本体里。

于是模型即产品不再是一句口号,而是一道研发的反问句:

这个功能,到底应该写在产品里,还是训练在模型里?

Sora2和nano banana Pro之后创作的门槛塌了,上限却被拉爆了 · 原文图片 2

王川的心动时刻来自 Sora 1。理由也很朴素:

视频终于不再像概念片,而像现实。

他看到的不止是以假乱真,更是产业面的震动:互动娱乐、电商、教育、游戏……几乎每个行业都能被视频模型重新开一遍门。

对他来说,加入浪潮的初心是把前沿技术用到真实生产里——不是让技术上墙,而是让客户的工厂、课堂、直播间都能用得上。

Sora2和nano banana Pro之后创作的门槛塌了,上限却被拉爆了 · 原文图片 3

老孙有两个瞬间,一个是 ChatGPT 把他拽进 AI;另一个更关键,是变身特效的模板上线后让 PixVerse 一个月长出千万级用户。

他从这个裂变里看到的是:

真正的拐点,不是技术多强,而是门槛有多低。

ChatGPT 不是最强模型,但它让普通人也能用;模板化封装提示词,把视频 AIGC 从高手的玩具变成了全民的语言。

那一刻,在爱诗科技把它叫做视频 AIGC 的 GPT 时刻。

Sora2和nano banana Pro之后创作的门槛塌了,上限却被拉爆了 · 原文图片 4

Richard(智谱)没有浪漫的闪光灯,只有一个现实的判断:

这是个已经能自己跑起来的赛道。

在2023年,Sora 还没发布时,智谱就已经在技术和商业化上做出了不俗的成绩。

他用一句玩笑总结自己的决策方法:既然重回科技赛道,要搞就搞最前沿的大模型。

听起来轻松,但背后是把趋势、团队与落地能力算了一遍后的理性下注。

Sora2和nano banana Pro之后创作的门槛塌了,上限却被拉爆了 · 原文图片 5

二. 当模型开始脑补,创作关系被改写

Chris 提了一个很有画面感的判断:Sora 2 给视频模型换了一种解法。

以前的路线是追指标:清晰度、运动质量、镜头稳定、时长一致性……像在考试。

Sora 2 更像在学懂你:你只需要描述意图,模型去补完细节,甚至主动替你建构呈现方式。

这背后的变化是:人从执行者变成导演。

导演不必自己扛机器、打光、剪辑、配乐;他只需要不断给反馈:

好还是不好?

这里再快一点。

别那么煽情。

AI 负责把导演的意图变成镜头语言。

换句话说,模型越会脑补,人就越像在做高层决策。

创作从体力活变成审美与选择。

而审美这种东西,恰恰每个人都有一点,只是以前缺一台能听懂你的摄像机。

三. AI 创造者到底是谁?答案比你想的更大

这一段讨论特别有意思,因为它把创造者从一个小圈子,拆成了一个社会级的新身份。

Richard 把智谱的创造者分成三种生态:

大型组织里的业务创造者:比如城市公交、能源、应急的普通员工。他们每天通过模型做服务优化,本质上也是在生产新价值。以前我们叫他们岗位人员,现在更像用 AI 重新定义岗位的人。

互联网高科技公司里的工程创造者:国内头部互联网公司在模型生态里形成了集体创作——一群人用模型把业务重新写一遍,从而优化用户体验,提高整体效率。

个人开发者:GLM Coding 套餐在发布后的几个月内付费订阅数量激增,说明一件事:代码正在成为新的创作语言,而且门槛在下降。

更有冲击力的是,他提了一人公司创业计划。

目标不是让每个人都成创业明星,而是让更多人能试一次靠 AI 打开新生计。

哪怕100万个一人企业中最后只有 1000 家跑出来,有投资价值的只有10 家,也足够让这 100 万人学会与 AI 相处,能更好地推动他们的就业技能,减少焦虑情绪。

老孙的分类更像创作生活史:

超级创作者是弄潮儿。他们像多模态时代的 DJ:LLM、TTS、视频模型混起来,拼出新的工作流。PixVerse 给他们能力,也给他们舞台(电影节、赛事)。他讲的超级个体艺术家的故事很重:一个人遇到挫折,靠着对艺术的理解和热爱,还有 PixVerse 再次回到职业舞台。技术不是让人躺平,而是让人重新站起来。

普通创作者是每个人。你上传一张图、写几句话,就能得到含声音、字幕、封面的一站式故事。以前每个人都是生活的导演是口号,现在真的开始变成产品能力。

王川把 AI 创作者写成了三个关键词:效率、混合、全球化。

一周剪一个月的工作量;

多模态工具混用;

从第一天就考虑出海。

这三件事合在一起,就是一个新的创作生产函数——时间、工具、市场边界同时被折叠。

所以你会发现,AI 创造者的边界越来越像氧气:

不是一个行业,而是一种生存方式。

四. 漫剧为什么火?因为它站在更高Beta 的地方

漫剧(AI 动画短剧)这段讨论也很河流视角。

Chris 说漫剧是短剧里更高 Beta 的子类。

原因不复杂:短剧预算有限,拍不出超现实大场面;

而漫剧用 AI 生图/动漫形态,天然适配想象力超车。

于是一个新的可能出现,一个人一部片的超创时代。

当视频模型每 3-6 个月发生一次范式级变化,爱诗两年迭代了八个版本的模型,未来的超级创作者可能会用一个模型栈做出不输传统工业的现实题材作品。

那时短剧产业的爆发,不是量的增长,而是质感阈值被打穿。

王川则更务实:Vidu 在漫剧行业已经覆盖了 70% 头部工作室。

他给出的关键能力是:

  • 时长/节奏控制(1 到 10 秒可控)

  • 人物表情强(哭、笑更自然)

  • 一致性稳(角色不变脸)

更重要的是,他讲了两派工作流:

图生视频链路:剧本→分镜→生图→动效

参考生视频(Reference-to-Video):先建角色库/道具库/场景库,再一句话生成视频

第二种更像数字实拍,它正在把漫剧从拼图升级成拍片。

他最后留下一个悬念:

漫剧真正的变量,可能不是画面更好,而是新的娱乐态势,实时交互。

从单向剧变成你能参与、你能改、你能跟角色对话的活内容。

五. 实时交互什么时候来?答案藏在架构里

这一问一答是全场最有未来感的部分。

Chris 解释了 Sand.ai 为什么走自回归路线:Diffusion 生成视频要等所有帧出来才能看;自回归可以像水一样边生成边播放。

当粒度从 1 秒压到 1 帧,实时互动就从概念落到工程。

他甚至给了个非常具体的时间锚点:

2025 年下半年就会看到苗头。

注意这不是一句未来会有,而是一个研发路线对市场形态的提前下注:

架构决定交互形态,交互形态决定新内容产业。

换句话说,你今天选择的模型路线,可能就是明天娱乐世界的物理规则。

结尾:创作这件事,正在从努力变成自然

这场 panel 听完,有一种很强的共识在底层流动:

视频模型不是在做更会生成的视频,而是在做更懂人类表达的介质。

当模型原生具备更多能力,人就把精力从怎么做转向做什么、为什么做;

当门槛继续被压低,创作就从少数人的职业变成多数人的日常;

当实时交互到来,内容不再是成品,而是可以一起生长的生命体。

也许几年后,我们回头看今天的漫剧、特效、短视频,会像回头看早期的短视频平台:

它们都只是一个信号,

创造权正在下放。

不是AI 取代创作者。

而是AI 把创作还给更多人。



更多对话细节

01. 开场与嘉宾介绍

赵亮:大家好,我是来自非凡资本的赵亮,也是今天第一场 Panel 的主持人。今天非常开心邀请到了智谱的 Richard 吴总、爱诗的老孙(孙总)、生数科技的王川王总,以及来自 Sand.ai的 Chris 苏总。

其实很多人说今天这场 Panel 最没有存在价值的就是主持人。有人建议让嘉宾们互相提问,那样会非常热闹。因为今天在座的嘉宾,他们的公司都是做大模型、通用大模型、多模态大模型以及视频模型的,在很多战场上可能都有过交锋。但没关系,今天的 Panel 相对比较 Peace(和平)。不过也给大家打个预防针,也许下次搞活动时,我们会再邀请各位来,到时候让嘉宾彼此提问,那可能会更有趣。

好,我们正式进入环节。首先请各位嘉宾做个简单的自我介绍。自从11月 Sora 2 发布以来,大家都有一些新动作,不同的公司也发布了新模型。我们先从Richard 开始。

吴玮杰 :大家好,我是智谱的吴玮杰。我在公司主要负责商业化落地工作。我们公司源自清华,目前服务了全球两百多万企业和开发者,是一家全链路自主可控、坚持自研基座模型的创业公司。希望未来能有机会跟在座的嘉宾和各位交流合作,谢谢。

孙伟哲:大家好,我是孙伟哲,来自爱诗。爱诗是一家做视频大模型的公司,我们的产品 PixVerse (国内叫拍我AI)在全球 C 端用户超过 1 亿人,B 端业务也在快速崛起。我主要负责 B 端业务,我自己在这个领域创业蛮久了,原来在飞书跟 Richard 也认识很久了。

王川:大家好,我叫王川,也是一名 AI 多年从业者。之前我一直在几家互联网大厂工作,在腾讯、网易、百度主要做 AI 相关工作,先后打造了大概 3 个千万级或过亿的服务企业客户的 AI 开放平台。现在我在生数负责企业服务,把我们的模型能力对外输出。大家可能知道我们的产品 Vidu,我们也是一家以视频为主的多模态公司,模型自研,和智谱一样也是清华系公司。我们服务了全球几万开发者和上千家企业级伙伴,谢谢大家。

苏果立:大家好,我是Sand.ai 的苏果立。Sand.ai 是一家聚焦在 AI 视频方向做模型研发的公司。我们的长期愿景是希望通过 AI 普惠人类,做更 To C 的业务。目前为止我们更多 Focus 在模型研发技术这块,但从 Sora 2 发布之后,我们可能也会逐渐加速在 C 端业务的落地。

我自己在公司负责产品相关工作,从 18 年开始创业,是连续创业者。在来 Sand.ai 之前也做了一款 AI 产品,当时在 Vast 做了一款 AI 3D 的创作者工具叫 Tripo。

02. 投身 AI 的Aha Moment(灵感时刻)

赵亮:我想问一个关于个人的问题。当年刚投入到 AI 创造大潮时,是否有那样一个特殊的灵感时刻(Aha Moment),让你觉得非常惊艳,从而毅然决然投入这个赛道?回过头看,当初的初心是否反映在现在的产品中?先请 Chris。

苏果立:

如果说对这一波 AI 最开始的感知,肯定还是 ChatGPT 刚发布的时候。但跟我自己做的领域关联度最高的关键节点,其实是今年年初OpenAI 发布GPT-4o image的时候。

GPT-4o 的生图能力给我非常大的感受是,它非常像一个 Vertical Agent(垂直智能体)。它能把大量之前需要通过工作流、不同工具配合语言模型调用才能实现的复杂图像编辑能力,直接内化到一个模型里。

当时看到那个东西,我就意识到这是一个大趋势的 Milestone:以语言模型为核心展现出的复杂智能,是有机会整合到多模态模型里的。这一点对我们触动很大。Sand.ai 在训练视频模型时,花了很长时间研究如何将自回归架构(Autoregressive)与传统的 Diffusion 生成模型做统一。GPT-4o 应该也是在类似方向上,从 Day One 训练时就把语言模型和生图模型做了整合。

这对模型即产品的定义带来了巨大改变。以前即使像 Midjourney,有个简单的 Discord 交互就行。但 GPT-4o 让我们意识到:所有我们想设计的产品 Feature,都应该先问自己,能否通过训练数据处理,让模型原生具备这些能力?

从那个时间点开始,我们做了很多开脑洞的实验。前段时间我们发了一个Gaga-1 的模型,它是全世界第二个能够音画同出的视频模型,同一批的还有 Sora 2 和万相的 Wan 2.5。这都得益于那时候的一系列尝试。

王川:Chris 刚才介绍的路线我们也比较敬佩。生数这边主要是以 DiT(Diffusion Transformer)架构为主做落地。

对我个人来说,最心动的时刻还是Sora 1 发布的时候(春节后)。各大群都在讨论,我看了很多视频,觉得它发布的内容已经可以以假乱真了。包括后来的气球人广告、跟好莱坞的合作,让我认为人工智能从语言模态慢慢往视频、多模态落地的时代越来越成熟。

我快速跟几个行业客户聊,发现视频模型或多模态模型覆盖的行业非常广阔,包括互动娱乐、互联网、电商、教育、游戏,大家对这个模型都特别期待。所以我决定加入这个浪潮。我的初心一直是把先进技术跟客户的生产实践相结合。

孙伟哲:我个人有两个 Aha Moment。

第一个也是 ChatGPT,当时非常震撼,觉得一定要搞 AI。那时候做了很多应用侧尝试,包括跟头部 MCN、影视公司做 AI 选题、脚本、RAG 等,但发现如果只是在这个生态位做 B 端业务,其实没什么优势。

第二个 Moment 是在去年 10 月份。当时爱诗为用户一键封装提示词上线模板功能,做了一款特变身特效。在此之前,PixVerse 的品牌知名度其实不太高,但这一个特效让它在一个月内积累了千万级用户,大量是自然裂变。

这给了我一个启发:ChatGPT时刻 并非纯技术比拼,是技术平民化让大家都能玩起来了。爱诗做的变身特效模板也是第一次让视频 AIGC 走入千家万户,不再是高端玩家的玩具。这大概算是视频 AIGC 的GPT 时刻。从那一刻起,我觉得爱诗在视频 AIGC 赛道的空间非常大,所以后来加入了爱诗。

吴玮杰:我也很难说是一个具体的Moment。我离开字节跳动后,在传统公司做了两年投资。ChatGPT 火了以后,我考虑回到科技赛道。当时我打电话问了一下还在字节的旧部,他说:现在还搞啥互联网,要搞就搞大模型。他建议我去研究六小虎。

我也考虑过上海的两家公司,但聊下来方向不太一致。当时是 23 年底,Sora 还没出来。智谱是市场上仅有的几家在做商业化的公司,第一年在商业化订单方面就有非常不俗的成绩,我觉得挺厉害。所以综合考虑,觉得这个赛道不错,就加入了。

03. 定义AI创造者与生态扶持

赵亮:现在的创造者已经不是传统意义的内容生产者,而是深度使用 AI 工具(如短视频、漫剧、视效、编程等)创造新价值的人。站在你们公司的视角,如何定义这批 AI 创造者?针对目前的市场(如火热的 AI 漫剧),大家有什么特定的扶持政策?

吴玮杰:我们的客户分为三类,对应不同的生态:

大型央国企与城市生态:我们会跟当地省市合作,形成本地生态圈。比如我们最近做的杭州城投,赋能公交、能源、应急等。这些普通的业务人员,每天使用大模型服务千家万户,我们认为他们也是创造者。

互联网高科技公司:比如美团等国内 Top 10 的互联网公司,大部分都在跟智谱合作。特别是今年 Claude(Anthropic)不对中国提供服务后,这对智谱是个利好,很多原本用 Claude 的用户都切到了智谱。

个人开发者:我们 9 月份推出了 GLM Coding 套餐,过去两个多月增长非常快。

针对主持人提到的一人企业/创作者,我们最近确实在研究,有考虑过推出一人公司创业计划,智谱可以和合作伙伴提供平台、场地、培训老师和全套服务。目标不一定宏大,比如服务 100 万创业者,如果有 1000 家能跑出来,最终有 10 家左右获得投资就很不错了。剩下的即便没跑出来,这段经历也能让他们对 AI 有更好认知,提升就业技能,缓解焦虑。

苏果立:拉长来看,我们希望 所有人都有机会成为创作者。每个人都有独特的生命体验和想表达的东西。

Sora 2 给视频模型一个不一样的解法:不再单纯追求传统视频的各项指标(虽然它已经是 SOTA 级别),而是让模型去脑补和包办呈现。用户只需要简单的描述意图。

这会改变人与创作的关系:人越来越像导演,而摄影、细节呈现交给 AI。人只需要不断给反馈:好还是不好、这里改一下。

关于漫剧,我认为它是短剧这个高 Beta 赛道里更高 Beta 的子类。因为短剧成本限制,很难拍出大制作(如《流浪地球》)。漫剧通过 AI 生图或动漫形式,更容易呈现超现实画面。

但随着视频模型进步(基本上每 3-6 个月就有一次范式级变化),未来可能超级创作者一个人就能用模型创作出不输好莱坞大片的现实题材作品。那时候,短剧产业可能会有更大的爆发,质感将不再是短平快的代餐。

王川:我对 AI 创作者定义为两大类:个人创业者和机构/工作室。他们有三个特点:

极致的效率追求:原来 1-2 个月的内容,现在一周搞定;

多工具的搅拌师:不光用视频模型,也用语言、音频、图像模型,是多模态工具的混合使用者;

全球化视野:第一天就在想出海。

关于漫剧,现在头部漫剧工作室70% 是在用 Vidu做相关内容。我们的 Vidu 模型特别适合短剧,因为:

秒级控制:1 到 10 秒都可以精准控制;

文戏表现好:对人物表情(哭、笑)控制到位;

一致性高。

漫剧现在有两派工作流:

一派是图生视频(剧本->分镜->生图->动效);

另一派是我们在推的参考生视频(Reference-to-Video)。这更像实拍,你先建立主角库、道具库、场景库,然后上传主角+道具+背景,一句话生成视频。像头部工作室酱油就在大量使用这种方式。

最后,我认为漫剧唯一的变数是新的娱乐态势,即 实时交互。现在的剧都是单向输出,未来模型方做出的实时交互形式可能会颠覆传统漫剧的表达。

赵亮:实时交互的多模态模型什么时候会来?Chris 你有没有答案?

苏果立:这个算问对人了。Sand.ai选择自回归路线就是考虑到了这一点。Diffusion 生成视频通常要等全部帧生成完才能看,而自回归可以像流一样,边生成边看。只要把粒度压得足够低(我们 4 月份发布的 Magi-1 压到了 1 秒,未来可以压到 1 帧),就能实现实时互动。

孙伟哲:我也回应一下。对于创作者的定义,我也分为两类:

超级创作者(超创):我定义为弄潮儿。他们像时尚博主一样,把各种模型能力(LLM+TTS+视频)串联起来,搭建工作流,产出 有创意的内容,起到了很强的科普和引领作用。我们会给他们提供模型能力、工程化能力,并举办比赛(比如绍兴文旅陆游900周年纪念挑战赛、爱奇艺和拍我AI的奇妙故事力、全球范围内的AI For Good挑战赛),参加瓦卡奖这种比赛,给他们舞台。

分享个案例:我们有个用户是住在美国弗罗里达的艺术家,23年时候因为中风倒下了,尝试了17款AI视频软件以后选择用上了PixVerse,后来成为了我们的创作者,并且现在已经成立了自己的艺术公司,成为超级个体,并上线了独立的产品接入我们PixVerse API进行创作。他在全球接到了活。这让我感到产品对活生生的人有实际价值,这就是 Tech for Good。

普通创作者:当年的土豆网口号是每个人都是生活的导演,但当时技术达不到。现在通过 Sora 2、PixVerse 的Agent 能力,用户上传一张图或简单 Prompt,就能生成包含声音、画面、字幕、海报的一站式故事。我们希望降低门槛,让每个人都能充分表达自己。

来源:非凡产研 · 腾讯新闻。文章中的“非凡产研”是原始发布账号署名,不代表已核实个人执笔作者。引用访谈或圆桌观点时,应按正文标明具体发言人及当时身份;无法确认时不要推断。日期为原始发表日期,历史信息以发布时点为准。

阅读原始发布版本 ↗
← 返回研究文章库