如果你把 AI 的过去两年总结成一句话,那就是:它把文字变成了内容。
但在2025北京非凡大赏上的这场关于AI 应用与 3D 生成技术的讨论里,我们听到的更像另一句预告,下一波浪潮,不是把内容做得更像真的,而是让世界本身变成可生成、可编辑、可交易的东西。
这场对话由英诺天使基金合伙人王晟主持,桌边坐着四位来自不同战场的玩家:Collov中国区负责人赵鹭,带着空间智能在家居与泛地产里打硬仗;心影随形/逗逗 AI 联合创始人王碧豪,把多模态 Agent 塞进游戏屏幕,做能陪你打怪也懂你情绪的 AI 伙伴;李白人工智能实验室/Cutout.pro VP 曹仁奕,用 600ms 的 API 交付速度在全球图像与 3D 生成市场里卷出一条生路;以及 VAST 对外首席合作代表李颖丽,她所代表的 Tripo,是今天全球 3D 大模型里最具代表性的中国力量。
你会发现他们的共同点很少:赛道不同、产品形态不同、商业化路径也不同。
但他们都在回答同一个问题:当 AI 开始理解空间、屏幕与物体之后,真正的护城河到底在哪里?是更炫的技术范式,还是更深的现实数据;是更大的基座模型,还是更好的交互与交付?
这一桌人,正在把答案一点点推到台面上。
一. 3D 不是从 2D升维那么简单,而是从现实取样
一开始王晟就抛了一个技术范式的问题:Collov 以前靠 2D 图像生成,如今做 Spatial AI,是继续2D 建 3D,还是用 3D Gaussian 这类新技术去做世界模型?
赵鹭的回答很反常识:路线没大变,但底层逻辑更清晰了.不是先去做 3D,而是先把真实世界吃透。
他举的例子很具体:在家装体系里,橱柜是定制化最深、款式最杂的一类。于是 Collov 把全球 97% 的橱柜款式都训练进模型里。听起来像辛苦活,甚至不够性感,但它带来的东西非常扎实:模型对物理世界的识别、超分、标注,最终都会回到真实数据的密度和干净程度。
这段话背后有个更大的启示:
世界模型不是用更聪明的方法生成,而是用更耐心的方式积累。
就像特斯拉的视觉算法没被通用模型碾压,原因不是它更会卷技术,而是它踩着真实道路跑出来的数据。Spatial Intelligence 也是同理。你可以把它理解成:模型确实越来越强,但你喂它什么决定了它最终能替你做什么。
这对很多创业者其实是个提醒:AI 的想象力越强,现实的颗粒度越值钱。不是所有公司都需要去做所谓下一代基座,但几乎每家公司都可以问自己一句:我所在的细分世界里,有没有一份别人拿不到的现实数据?
二. Agent 的难点不是工具链,而是屏幕背后的心智
聊到心影随形/逗逗 AI(逗逗伙伴)的时候,王晟把话题从空间拉到屏幕。因为游戏 Agent 的复杂性表面上看像技术轰炸:要看视频、听语音、懂环境、记住玩家偏好、理解任务链……但王碧豪反倒从 Gemini 3 的发布讲起。
他说 Gemini 3 Pro 的屏幕理解(Screen Pro)分数从 11 冲到 70+,这意味着模型的多模态理解第一次显著逼近人类。更关键的是,他观察到:Gemini 的提升不只是感知,而是一种学习/推理能力。你给它一个线框,它能直接输出审美在线、可交付的前端项目。
于是他顺势抛出一句很有分量的话:
Use Case 是找出来的,不是做出来的。
也就是说,Agent 的价值不在于堆 Workflow,而在于让模型在具体情境里去判断该用什么工具、以什么方式帮你达到目的。他们甚至把内部表述从 Workflow 转向 Reasoning,就是要让模型在游戏世界里更像一个懂你的人,而不是一个会工具的人。
这就把护城河指向了两个点:
一是游戏专业数据调优:让模型理解游戏屏幕而不是仅仅理解真实世界。
二是上下文与交互形态:通用模型能看懂橱柜,但不一定懂设计师的交互;能识别游戏画面,但不一定懂玩家那句我真服了的情绪到底是在骂队友还是在自嘲。
说白了,Agent 不怕大模型变强,怕的是你没有把强变成好用的那层产品心智。
很多人聊 Agent 时兴冲冲地讨论工具调度、长链推理,但真正的胜负手往往更朴素:你有没有把用户的情绪、习惯、节奏,编进系统里。
三. API 生意拼的不是模型多能干,而是能不能在 600ms 里干完活
轮到 Cutout.pro 时,王晟问得很直接:在全球图像榜 Top50 这么卷的战场里,你们为什么还能持续赢?
曹仁奕的回答里没有一句玄学,全是做生意的人话:
先发优势当然重要,但真正让 API 业务跑起来的,是三件事——场景、速度、Know-how。
场景差异化很好理解:同样是 3D 生成,室内设计要厘米级精确,游戏要想象力爆炸。你给两拨人同一个 API,结果一定是两边都嫌弃。
速度问题就更真实了。他举了 POD(按需打印)电商的例子:买件 T 恤,用户插个头像想立刻看到效果。如果你让他等 10 秒,他已经去隔壁下单了。Cutout.pro 的 API 600 毫秒返回,这在电商里不叫优化,叫生死线。
而 Know-how 的意思更像是一种工程师 + 产品经理 + 商业操盘手混合出来的判断力:
你得知道技术现阶段能做到什么、做不到什么。
比如真人微表情捕捉还不完美,那就别硬上写实路线;但卡通风格已经很稳,就把它做到极致。
这不是妥协,而是把技术边界当成商业边界来驾驭。
听起来有点冷酷,但这就是现实:
当 AI 进入产业链,模型能力只是入场券,交付效率才是护城河。
别小看那几百毫秒,它背后是转化率、复购率、客单价,甚至是你能不能活到下一轮融资。
四. 为什么 3D 生成成了中国之光?因为中国同时拥有人、数据、产业压力
当话题来到 VAST / Tripo,王晟抛了一个看似感叹、其实很尖锐的问题:中美模型竞争里,美国在文本和多模态领先,但在 3D 生成基座上,中国公司反而压着打,为什么?
李颖丽把答案拆成三层:
人才优势、数据优势、产业推动。
SIGGRAPH 上六成以上作者是华人,这相当于 3D+AI 交叉学科的人才主矿脉就在华语圈。
中国又是 3D 产业的超级场景库:游戏、电商、工业设计、3D 打印、具身智能……这些链条每天都在生产高精度模型数据。
而更关键的是,产业需求足够急。急到什么程度?急到逼着技术得快速落地,否则就会被下一波需求淹没。
但她也说了一个值得全场沉默两秒的事实:技术在中国,应用在海外。
Tripo 的用户 85% 是外国人。你能感受到一丝无奈,也能看见一个趋势:
中国在 3D 基座上领先,但最先爆发的消费力和创作需求可能还在外面。
这意味着什么?
意味着 3D 生成很可能成为下一种技术出海必选项:模型在国内迭代,市场在海外兑现。
就像今天的几位嘉宾同时提到的那样,海外订阅、基础设施、付费习惯、汇率优势,决定了 AI 应用大概率先在外面把钱赚厚,再回来把产业做深。
五. 3D 打印的故事很重要,因为它让人人都是创作者第一次变成硬件事实
这场对话的结尾,其实是把 3D 生成从软件想象推到硬件现实。
VAST 正在和一堆 3D 打印头部厂商合作:拓竹、Anycubic、创想三维……甚至 Stratasys 这样的工业巨头也成了战略伙伴。
李颖丽的判断很直白:
过去 3D 打印机普及不起来,不是机器不行,是模型门槛太高。
模型一旦被 AI 拉平,打印机市场就会从少数人玩具变成家庭工具。
你可以把它类比成当年的纸张打印机:
如果每个人都能一键把脑子里的小玩意儿变成 3D 模型,那打印机就不再是极客玩具,而是家里那个新的微波炉。
这件事对 AI 行业的意义很大:
当 AI 把创造力变成可复制的日常能力,产业的增长曲线会突然从缓坡变成断崖式抬升。
因为它不是让你更高效,而是让你第一次有资格参与。
最后,把四家公司放回同一张图里
如果把这场对话压成一句话,我会说:
AI 应用的下一阶段,不是看谁的模型更大,而是谁更懂世界的细节。
Collov 用细分真实数据去取样世界;
逗逗 AI 用多模态推理去陪伴世界;
Cutout.pro 用速度和场景去交付世界;
Tripo 用 3D 基座和产业链去扩展世界。
他们四个像是在不同的门口站岗,但守的是同一座城:
从生成内容到生成空间/生成物体/生成体验的新文明入口。
而对我们这些围观者、从业者、创业者来说,最值得带走的可能是三个词:
数据的深度、交互的温度、交付的速度。
模型会越来越强,这几乎是确定的;
但你能不能把强变成真实用户愿意用、愿意付费、愿意依赖的东西,才是你真正要回答的问题。
毕竟,世界从来不是被模型改变的。
世界是被把模型用对的人改变的。
更多对话细节
一、 嘉宾自我介绍
王晟:今天非常高兴能参加吴畏总和非凡举办的这场盛大的 AI 应用活动。我们也都是老朋友了,我看了一下今天在座的嘉宾,都是经过精心挑选的,跟我们今天的主题关系密切,而且都是非常优秀的头部产业企业。接下来先请大家做一个自我介绍,每人一分钟,后面的话题我们再展开。
赵鹭:谢谢主持人,谢谢王老师。我是 Collov中国区负责人 赵鹭,也是产品的商业化和市场化负责人。我们是一家来自硅谷的公司,前段时间大家可能被李飞飞的一篇文章刷屏了,关于Spatial Intelligence(空间智能)是人工智能的下一个十年。我们最早在 2021 年就在这个方向上布局,是一家既做自研底层视觉大模型,同时又做垂直应用的公司。
目前我们在全球 ToC 和 ToB 的用户加起来,总注册量几百万。我们已经融了四轮资,SMB数量超2万家。现在主要聚焦利用空间智能技术服务泛地产和家居家装领域。谢谢。
王碧豪:感谢王老师。我是来自逗逗 AI 的王碧豪。我们的产品逗逗伙伴是一款面向游戏玩家的 AI 伙伴,通过实时感知游戏屏幕和实时语音,提供攻略辅助和情绪价值。我们在海外的产品Hakko.AI,目前在全球累计已有 1000 万以上的玩家使用过。在 MAU(月活跃用户)上也有好几百万。
对我们这两款产品而言,最主打的其实是多模态感知能力。这其实和最近比较火的 Google Gemini 3 是同一个概念。待会儿我也会多讲讲 Gemini 这次发布对我们的一些启示。
曹仁奕:大家好,我是李白 AI 的联合创始人兼产品总监曹仁奕。我们的公司名字大家可能不太清楚,但产品名字可能会略有耳闻——Cutout.pro。我们是唯一一家5次登上 a16z 全明星榜单的中国企业,每月有 1400 多万的流量。我们主要对外提供 API,涉及抠图、高清化以及与今天主题相关的 3D 生成。后面可以聊更多,谢谢大家。
李颖丽:大家好,我是来自于全球领先的 AI 生成 3D 大模型公司 VAST 的李颖丽。我们的产品叫 Tripo,在国际上享誉度非常高。目前基于 Tripo 平台,我们聚集了 500 多万的创作者,全球有 4 万多个中小型客户,大客户也有 700 多家。基于我们平台生成的 AI 3D 模型已经突破了亿级。
其实 VAST 的产品 Tripo,不管是在团队阵容、产品能力、用户反馈,还是 API 的用户量级上,在全球都是处于第一的位置,也是行业的领军企业。
王晟:谢谢四位嘉宾。我也花一分钟做个介绍,我是英诺天使基金的合伙人王晟。英诺主要投早期初创项目,我们愿意给创业者第一张支票。现在的单笔第一轮投资金额也接近 2000 万了,目前管理大概 60 多个亿的资金。我们投了非常多的 AI 机器人、具身智能的明星项目。
具体到今天这个3D 和游戏的主题,我们是 VAST 的早期投资人;大家看到鸿蒙系统里刚发布的一个应用(注:推测指 Rodin 或同类 3D 应用),在过去一个月里一直是鸿蒙下载量第一,超过微信和抖音,是个现象级产品,也是做 3D 重建的,这这也是我们第一轮投资的项目。在游戏上,我们是游族网络的天使投资人,也是年收入几十亿的柠檬微趣的天使。
总结一下阵容:我们有做 AI 家居设计的 Collov AI,可以说是 Spatial Intelligence 公司;有做游戏陪伴、典型 Agent 应用的心影随形;有图片生成领域的王者李白/Cutout.pro;也有 3D 模型生成的王者 Tripo (VAST)。这个阵容非常强大,相信大家的功底都很深厚。
二、 技术路线与产品护城河
1.关于 3D 生成的技术范式
王晟:第一个问题给到 Collov AI 的赵总。我印象中你们之前是用图像 2D 生成的方式,来生成更高质量、可控性高且一致性高的图像。现在你们做 Spatial AI,技术范式有改变吗?是继续用 2D 重建 3D,还是会使用像 3D Gaussian Splitting 这些新技术去构建呢?
赵鹭:其实我们的技术路线一直没有发生大的变化。我们要拉回到刚才说的,为什么聚焦在房地产和家居这个业务体系里。
单纯从计算机视觉来说,很多识别算法用在了像生产线检测,包括美国专门用来修检测屋顶的公司也做得很大。我们认为,要想把空间智能做好,首先要打通图像的底层识别算法、超分算法和标注。也就是说,它对物理世界本身要有一个非常清晰的数据基础。
所以我们训练了全球 97% 的橱柜款式,因为橱柜是家装体系里定制化程度最高的。我们在细分领域去打透,用真实物理世界的经验和数据去赋能,然后再去做虚拟,再去跨越。是这样一个技术路径:先做好真实物理世界的赋能和数据采集。
王晟:这很有意思。大家构建 World Model(世界模型)有一大流派是用 2D 去建 3D。但这么多搞图片生成的,包括李白、Google、Midjourney,这些基座模型不会卷到你们吗?
赵鹭:这就看大家最终在哪些细分数据里深耕。比如特斯拉,如果它只做最基础的视觉汽车模型,按道理英伟达早该把它碾压了,但实际上特斯拉的视觉算法依然领先,就是因为数据。我们也是同理,专注于细分产业的数据积累。
2. 关于 Agent 的复杂性与多模态
王晟:第二个问题给到碧豪。我理解你们是在做真正的 Agent(智能体),这是目前最热的方向,但也挺复杂。你需要对游戏的视频、语音、环境做理解,还要了解玩家喜好、情绪、游戏任务 Memory 等等。这事儿有多复杂?腾讯如果来卷你怎么办?
王碧豪:聊 Agent 离不开大模型。我想从 Gemini 3。讲起。这次 Google 发布重点讲了 Multi-modality(多模态),以及 Learn, Build, Plan 这三层能力。DeepMind 的 Hassabis 讲的是 Benchmarking。
这次提升非常显著,Gemini 3 Pro 尤其是 Screen Pro(屏幕理解能力)的评分从 11 分提升到了 70 多分。这意味着模型对于屏幕、对于多模态信息的理解已经可以和人比肩。
我们在实测中发现它的前端项目生成特别厉害。比如做一个微信小程序海报生成器,Gemini 3 和其他模型对比,它的审美特别好。你给它画个简单的线框图,它生成出来的东西直接可商业交付。这代表 Google 把它当成一种学习能力,而不仅仅是感知能力。
这正是我们可以切入的点。Use Case(应用场景)是找出来的,不是做出来的。我们现在不叫 Workflow(工作流),叫 Reasoning(推理)。由大模型去判断用什么工具做什么事。
我们的护城河在于:
数据调优:我们有一套模型体系,用了大量游戏专业领域的图像数据进行调优。让大模型真正理解游戏屏幕,而不是像通用模型那样理解真实世界。
Context 和 Interaction(上下文与交互):你的交互形态和上下文理解必须优于通用大模型。就像刚才赵总说的,通用的模型能生成橱柜,但没有设计师的交互优化是没法用的。交互一定要优于大模型。
王晟:特别认同。我有个朋友叫杨樾(中国 AI 音乐第一人)也说过,基座模型再强,最后拼的是审美。Midjourney 为什么好?因为审美高级。
3. 关于 API 与垂直场景的差异化
王晟:第三个问题给到李白的仁奕总。Cutout.pro 长期在全球图像榜排在 Top 50,竞争非常激烈。你们为什么这么优秀,比别人还能卷?
曹仁奕:我们是 2019 年就开始出海,有先发优势。
第一,场景差异化。我们提供 API,深入不同行业。比如 3D 领域,室内设计和游戏需求完全不同。室内要的是精确(几厘米的吊顶、一比一复刻);游戏要的是想象力和视觉冲击力。随着大模型技术推进,垂直行业有更大机会深入不同场景。
第二,速度与转化率。像电商领域的 POD(按需打印)业务,用户要把头像印在 T 恤上。如果用大语言模型 API 动辄 10 秒、20 秒,客户早跑了。我们的 API 可以在 600 毫秒内返回图像,这对电商的转化率影响巨大。
第三,Know-how。比如 Fashion Try-on(虚拟试穿)和 Furniture Try-on(家居试摆)。对于创作者或短剧,可能需要人物 ID 保持不变但发挥想象力;对于视频,现在的能力还做不到真人微表情的完美捕捉,但做迪士尼卡通风就很完美。我们要知道技术的能与不能,在能力范围内发挥最大价值。
4. 为什么 3D 生成是中国之光?(提问 VAST)
王晟:中美大模型碰撞中,文本、多模态美国领先,但 3D 生成基座模型上,无论是技术领先性、用户规模还是创业公司数量,中国都大大占优(以 VAST 为代表)。为什么 3D 生成成了中国之光?
李颖丽:AI 3D 是人工智能和图形学的交叉学科。
人才优势:大家去过 SIGGRAPH(图形学顶会)就知道,全球 AI 项目中六成以上的作者是华人。我们公司囊括了全球最优秀的这部分年轻科学家。
数据优势:中国 3D 相关产业非常丰富(游戏、电商、工业设计、3D 打印),是数据大国。获取数据的多样性和灵活性让我们拥有全球最多的高精度 3D 模型数据集。
产业推动:我们很想赋能产业,而中国的产业需求(如具身智能、3D 打印)反过来推动了我们快速发展。但客观地说,虽然我们的技术是领先的,但我们平台上 85% 的用户还是老外。也就是技术在中国,应用在海外。
三、 商业化与市场(AI 应用如何赚钱)
1. Collov 的出海与国内策略
王晟:Collov 在硅谷创业,北美发展不错。赵总作为中国区负责人,你们除了给客户 AI 能力,会帮他们出海吗?国内情况如何?
赵鹭:Collov 的基因脱胎于斯坦福 AI 实验室。我们在李飞飞创业之前就开源过一个 World Model 相关的项目。
目前海外增长很快,除了北美,巴西、中东和中亚增长也特别快,月增速大概 30% 到 50%。我们在 Google AdWords 上一些核心关键词是霸榜的。
国内策略跟 Tesla 进中国很像:
合规先行:我们较早拿到了相关认证。
抓头部:先跟政府、大产业带、上市公司合作,产生领头羊效应,再往下铺腰部商家和工作室。
模式差异:海外全是纯 License/SaaS 模式;国内是虚实结合,做项目。比如我们跟北京某国资背景装饰公司落地了一万多平的旗舰店。国内要做得重一些。
王晟:有没有担心钱还是老外的好赚?
赵鹭:确实。海外大家习惯付费,国内即使是做得很棒的产品,也往往需要做轻应用矩阵来跑市场验证。
2. 心影随形的增长与变现
王晟:你们上线一周就几百万用户增长,怎么做到的?商业化怎么考虑?
王碧豪:关于增长:
靠内容:内容的核心是真诚,要有杠杆能力,通过内容撬动 KOL 和 Influencer。
冷启动(Cold Start):制造话题热度,让传播者觉得这个话题值得传播。
我们没法像字节跳动豆包那样一个月砸巨资买量,更多是用杠杆模式。
关于商业化:
昨天我跟美国记者聊,我说你得明白 China's ToB ecosystem is different(中国的 ToB 生态完全不同)。在美国,你能找到大量愿意为 SaaS 付费的小生意;在中国,小生意很难接触到高端 AI 服务,且付费意愿低。中国 C 端用户现在消费力也受限。但美国人有 Tipping Culture(小费文化),87% 的人愿意每月打赏 30 美金。
所以我们现在重点也是做美国市场,做订阅。
3. 李白 AI 的收款问题
王晟:国内用户确实不爱付费(B端C端都不爱)。仁奕总,你们能收上钱来吗?
曹仁奕:我们绝大多数收入来自海外。
商业氛围:海外习惯使用外部服务,因为人力贵,交易成本比管理成本低。
基础设施:海外有成熟的 订阅模式(Subscription),可以每月自动扣款(MRR/ARR)。在国内,除了微信支付宝这种巨头,普通企业很难要求用户每月自动扣款。
汇率:1 美元兑 7 人民币,购买力也有差距。
王晟:(现场调研)在座各位为 AI 产品付过费的举手?……还是不少的,但你们太不典型了。确实,出海赚美金是目前的共识。
4. VAST 的新商业探索(3D 打印)
王晟:听说 VAST 和国内最头部的 3D 打印厂商都在合作,这似乎是个新的增长点?
李颖丽:是的。家用级 3D 打印机未来一定是一个爆发式增长的市场。
过去 3D 打印机用户全球也就一千多万,瓶颈在于 3D 模型(属于精英艺术,普通人不会做)。现在有了 AI,小白用户都能生成模型,人人都是创造者,这会让打印机市场从几百万量级飞跃到几十亿量级。
我们在国内深耕 3D 打印行业,像 拓竹(Bambu Lab)、Anycubic(纵维立方)、创想三维(Creality)、爱乐酷等都是我们的客户。全球工业级打印机巨头 Stratasys 也是我们的战略伙伴。在这个细分领域,我们的市占率非常高,基本接近 100%。
四、 结语
王晟:非常棒。3D 打印机就像当年的纸张打印机,未来会进入家庭。像拓竹这样的公司估值已经达到100亿美元。希望未来成本降低后,大家都能用上。也祝在座各位嘉宾赚大钱,尤其是希望能在国内赚钱。