跳到正文
非凡资本

访谈与对话 / UNIQUERESEARCH

大模型和生成式AI在视觉领域的突破性力量|非凡观点

   背景介绍
大模型和生成式AI在视觉领域的突破性力量|非凡观点 · 原文图片 1
2024年1月24日,非凡资本联合诸多合作伙伴在上海举行了“2024 AIGC应用发展高峰论坛”,近千名AI相关从业者参与了本次活动。本期内容整理自嘉宾主题演讲环节。
   嘉宾
井英科技 创始人兼CEO 朱江
智子引擎CEO 高一钊
无界AI 联合创始人兼CTO 张飞彪
LibAI联合创始人兼产品总监 曹仁奕
中科深智 创始人兼CEO 成维忠David 
   圆桌精华
Q:现在的视频生成模型主要是2D形式,而中科深智走了一条3D的路线,这可能是未来更容易能够泛化应用到整个行业里的一种技术吗?
中科深智 创始人兼CEO 成维忠David :
这个争议其实比较大。我跟很多做大模型的同学聊到meta,尤其聊到杨立昆教授的时候,大家都觉得他已经过气了,他所谓的讲法都不靠谱,只有OpenAI和一些当红的年轻的新生代才是有价值的。但是杨立昆最近有一个采访,它里面提了一个基本的概念,就是在视频的认知和视频生成方面,现在走的这个方式可能是有问题的。
大型语言模型运用了“下一个词预测”(next token prediction)的技术,这种技术同样适用于视频生成,特别是在像素空间生成方面。它依据已有的像素点来预测接下来的像素点。
杨立昆教授提出了一个关键理念:视频的实质不单是像素间的关联,而是在于表征空间的相互关系。对于许多人而言,“表征空间”是一个相对抽象的概念。在这个空间中,我们所感知的物理世界并不能完全通过像素点来充分展现。实际上,表达这个世界的方式是多样化的,它不仅包括语言和图形图像,还涵盖了数学公式等多种形式。杨教授认为,视频处理的核心挑战正在于如何有效地管理和解释这个表征空间。
无界AI 联合创始人兼CTO 张飞彪:
我完全同意,未来3D和视频生成技术将继续扮演关键角色。目前,我们更专注于图像领域,因为图像生成技术已经相对成熟,它的高质量输出和精准控制使得与实际产品的结合变得更加可行。
现在我们使用大量的设计素材,以大模型为基座训练出自己的行业模型,再通过行业模型去解决一些专业领域的设计需求,比如在服装设计行业,服装模型的设计能力会得到大幅强化,同时可以通过丰富的数据标签体系做到精准控制,以便提升最终的出图质量和效果。
同时,我们还会结合企业独有的数据和设计标准,确保符合一个企业的整体设计要求,这样一来,最终可以客制化出一个完整的企业模型。在实际使用中,可以帮企业做到比较高效的产品设计与内容生产,做到降本增效,以及创新业务的引入。
比如无界AI最近与万事利合作开发的丝巾大模型,利用这个模型他们的设计师能够创作出独特的丝巾样式,从而在内部降低成本并提高效率。对外,客户也可以用这个模型定制个性化的图案和花纹,再通过万事利的柔性生产技术将其印制在丝巾上,创造出独一无二的作品。
Q:无界AI的技术路线选择是什么?
无界AI 联合创始人兼CTO 张飞彪:
技术上其实要说明下,我们并不仅限于图像部分,而是更多定位为多模态生成。目前在多模态领域,图像是更成熟更落地的,所以当前我们在图像领域的投入会更大一些,但我们的平台还提供了视频生成、3D生成、文本处理等能力。
未来我们也会继续加强在视频生成方向的探索,更好的为企业去提供一站式的 产品、模型、算力 AIGC解决方案,我们的C端产品比如无界AI App都有提供,同时在无界专业版上,结合工作流模式,创作能力会更加强大,也更加高效。
Q:井英当初为何选择去做视频生成模型?难度大不大?
井英科技 创始人兼CEO 朱江:
我们的思考角度可能更侧重于场景而非技术,这和我们之前的创业经历有关。我们曾创立一家与AI和内容相关的公司,名为触宝科技。触宝在海外是最大的第三方输入法,我们团队深入研究语言模型长达十年。此外,我还带领团队从零开始打造了一款拥有1000万DAU的小说APP。
GPT3的发布让我们看到了AI生成内容的潜在机会,尤其是AI生成视频,可能会构建出新的内容平台。过去两年,我们一直围绕这个目标努力,不断升级技术。在技术上,我们尝试过不同的方法,从1.0版本的基于transformer的广告生成,用到了一些模型组合的方案,到2.0版本的基于扩散模型的AI短期生成。更重要还是用什么技术解决场景里的问题,达到公司的核心目的。
从技术角度看,视频生成仍然面临着相当大的挑战。然而,在过去的半年里,行业已经取得了显著的进展。我坚信,再过一年,会迎来一个重大的技术跨越阶段。
Q:智子引擎采用的是多模态技术,您如何看待这条技术路线及其发展前景?
智子引擎 CEO 高一钊:
我们团队在2020年就开始做大模型,是国内最早研究大型模型的团队之一。在CLIP、文档和SD等基础工作尚未出现时,我们就开始从零构建。在2020年和2021年,我们专注于视觉与文本空间的融合和表征对齐。基于这些基础工作,我们在2022年进一步进行了SD和类似SVD或runway的视频生成工作。
我认为,技术是否成熟,取决于其实际应用的要求。例如,语言生成技术的准确性和流畅性对用户体验至关重要。我们日常交流中的任何错字或语序错误都会直接影响我们对模型的感知。
而在图像视觉技术方面,除了专业美术人士外,大多数人对画面的要求相对宽容,只要内容准确且清晰,通常就能被接受。因此,视觉技术在图像生成方面的发展似乎更为先进。
作为技术出身的人,我一直关注学术前沿的发展。从最早的ViT到22年的diffusion模型,再到2023年,尽管技术本质上并未有显著进步,但视觉基础领域,无论是理解还是生成,都迫切需要类似transformer在语言领域的那种突破性进展。因此,我相信,对基础模型的投入仍然是值得的。
相较于图像,3D和视频具有更多的空间或时间维度,因此增加了预测任务的复杂性。因此,在我们尚未完全掌握图像预测技术的情况下,涉足视频和3D领域必定会更加困难。
目前有许多在3D和视频领域崭露头角的新公司,它们提出了各自的解决方案,并基于现有基础进行优化。这些公司的涌现必定是有其价值的,而这项基础工作的完成离不开整个学术圈的共同努力。
中科深智 创始人兼CEO 成维忠David :
现在大家在3D技术的视觉层面关注较多,但从视频生成角度看,3D更多涉及动作和表情生成等微观问题。例如,生成人物模型时,现有方法很多,但生成的人物本身通常不带动作。我们倾向于将人物动作与模型分开处理,未来在2D人物驱动上,可能需要使用3D的动作和表情数据来驱动2D人物视频的生成。所以这里面有很多技术路线,大家可能各有各尝试的路径和实践。
Q:面对新兴的开源模型,企业应如何平衡现有的技术投入与未来潜在收益之间的关系?
LibAI人工智能实验室 联合创始人 曹仁奕:
3D技术无疑是未来发展的重要方向,它能够精确地表达和控制复杂的概念,这也正是当前客户所追求的。除了图像生成的质量,多模态交互同样是一个值得探索的领域。
例如,OpenAI的大型语言模型在一致性和逻辑性方面优于diffusion模型,能够处理更为复杂的表达,如将女强人的影子比作女超人这类隐喻,这是SD模型难以理解的。
尽管如此,SD模型在经过大量图片和文本训练后,其生成的图像质量相当高。虽然当前3D生成的质量可能略逊一筹,但作为一家追求快速商业化的公司,我们需要在技术创新和商业需求之间找到平衡点。在LibAI人工智能实验室,我们正致力于多项前沿研究,以保持在行业中的领先地位。
Q:如何权衡自主研发机器学习模型与使用API、开源模型进行二次训练的选择?在资源投入与预期成效之间,是否存在一种平衡策略,以决定是否需要进行自主研发?
井英科技 创始人兼CEO 朱江:

商业化的关键在于回归到公司的核心——你的基础业务和产品决定了商业化的方向,而非遵循某个统一的策略。

以我们公司为例,我们专注于利用人工智能技术创作高品质的视频内容,特别是在短剧制作领域。我们投入研发自主的视频生成模型,以确保内容的创新性和个性化。对于视频中的语音部分,我们采用了行业内成熟的解决方案作为补充,并始终保持对第三方技术开放的态度,以实现优势互补和资源整合。
我们认为,真正的关键在于深化对自身业务的理解,明确自身的核心竞争力和市场壁垒。因此我们的决策不仅仅基于是否选择开放或接入第三方服务,而是更注重如何通过这些技术选择来加强业务优势,从而在市场中保持领先地位。
技术的发展是一个不断前进的迭代过程,我们必须在AI生成领域持续推动核心技术的创新。AI创新的道路充满不确定性,只有不断探索和前进,才能找到最适合业务和场景的技术解决方案。
Q:我要追问一下朱总商业化的问题。您觉得目前视频生成技术发展到什么阶段了?到什么阶段客户才会花钱买单,怎么实现商业化?其中的障碍在哪儿?
井英科技 创始人兼CEO 朱江:
在商业化的过程中,无论是面向企业(B2B)还是面向消费者(B2C),都有成功的案例。视频生成技术在不同应用场景下对质量和可控性的要求不尽相同。在广告营销、ToC短剧制作等领域,许多公司,包括我们自己,都认为已经达到了商业化的临界点。然而,要实现规模化和真正的商业成功,还需要考虑更多的细节和因素。
商业化策略与业务的相关性密切。有了核心技术并不意味着就能自动扩大规模。公司可以选择开发大模型,或者专注于工具的开发,每种策略都有其独特的扩展方式。首先,我们需要从商业角度评估一个场景的可行性。
很多时候,我们可能会忽视或在项目后期才考虑AI项目的商业逻辑是否成立。其次,我们必须立足于客户或用户的角度,深入思考他们的需求。用户追求的并不仅仅是技术本身,技术往往是实现需求的一种手段。根据我们的经验,业务的增长与技术的应用之间存在着密不可分的联系。
从AI工具的角度来看,海外的产品驱动增长(PLG)策略在工具自我增长方面有许多成功案例。在国内,面向大客户的模型开发也有许多成功实践。在AI短剧领域,我们生成的视频在TikTok上的表现非常出色,单条视频播放量已超过百万,用户的点赞、评论和反馈都非常积极。
现金流是结果的体现,关键在于用户需求是否得到满足,以及这种满足是否采用了对用户来说更有效率的方式。从经营角度来看,如果要满足与现有公司相同的需求,我们的优势在哪里?这是一个需要在每个领域具体回答的问题。
Q:技术公司推进商业化要重点考虑哪些因素?
无界AI 联合创始人兼CTO 张飞彪:
无界AI自成立之初,就明确定位于应用层,致力于推动AIGC技术落地,帮助客户解决实际问题。我们提供的不仅有软件产品和技术服务,更重要的还是模型定制,在我们看来大模型虽然能培养通识能力,但在解决具体问题上还存在一定差距。
我们不仅提供通用的图像生成能力,更是倡导行业模型的概念。先进行行业细分——服装、家居、建筑、汽车、摄影等等,然后为每个领域训练出行业模型,保证这些模型更贴合对应行业的具体需求。同时也基于这些行业模型,为相关企业定制了专属的企业模型。
在视频领域,我们已经落地了一些成熟的应用案例。最近我们与浙江联通合作,结合图像、视频和音乐生成等技术为客户提供个性化的彩铃视频服务,实现了跨模态的内容创作。
此外,我们还利用AI生成技术制作AI漫画和漫剧,并在优酷、腾讯视频等平台上映,所有产品和服务都旨在提供解决方案,以价值输出为核心。
在商业化方面,我们的付费模式表现良好,目前处于快速增长期。C端用户数三百多万,而B端合作的政企客户则有两百多家。销售方面,我们的营收也已经达到数千万级别,国内市场商业化落地效果良好,这也是我们在元旦后专门举办了无界AI生态合作伙伴大会的原因。
Q:LibAI的流量已经是全球第17了,收入有无界AI高吗?
可能会多一点。我们的产品cutout.pro和pro AI都采用了PLG模式。除了开发者市场,我们的主要客户群体是中小型企业(SMB),其主要聚焦在电商领域。电商行业很高频的一个场景是AI超模技术解决了传统模特图的局限性。在全球范围内,找到多样化的模特——如内衣模特、黑人模特、男模特或大码模特——是一项挑战。
通常,即使找到合适的模特,也可能导致网站上图片的单一性。但利用AI技术,我们能够创造多样化的模特形象,满足不同地区和文化的需求。在电商领域,我们卖的不仅是商品,更多的是通过图片激发的消费者想象。当图片与消费者的文化和人种背景相符时,它们更容易产生共鸣,激发购买欲望,从而提高转化率。
Q:中科深智目前商业化发展到什么阶段?
中科深智 创始人兼CEO 成维忠David:
作为多次创业者,我曾领导过多家公司。以往的公司盈利周期相对较短,因此我期望创建一家更加技术导向、长期发展的公司。然而,之前有嘉宾提到国内资本市场的残酷性,这使得我们必须设定一个明确的商业目标:到2024年,公司必须实现全面盈利,这是我为公司确立的必须完成的目标。
当然,实现这一目标面临着诸多挑战。为了快速实现盈利,我们可能需要放缓在技术方面的投入步伐。同时,我们将更加专注于3D和视频领域,特别是短剧和电商领域。考虑到国内市场的巨大存量,这些领域被视为蓝海,但同时也可能成为红海,吸引了大量竞争对手。为了迅速实现收入增长,我们很有可能在这个市场中加速拼杀。
Q:技术、产品、服务,哪个更重要?
中科深智 创始人兼CEO 成维忠David :
在国内市场,技术与服务的结合显得尤为重要。由于产品同质化现象普遍,企业间的模仿快速发生。视频剪辑市场涌现了大量智能工具,从初创到大型企业都在争夺一席之地。我预见未来这个领域将由拥有强大多模态大模型和视频理解能力的大厂主导,但这并不意味着小公司没有机会。小公司虽无法在技术上与大厂竞争,却可以通过提供增强服务来寻找市场机会。
在内容生成方面,情况更为复杂。不同公司选择不同的路径,我们专注于可控内容生成,而不是追求创意。如果市场趋势向创意倾斜,我们可能会更加关注这一领域。虽然我们的创意可能不如其他公司,但在需要高度可控生成的领域,如电商,我们有自己的优势。未来,我们期待能以极具竞争力的价格提供生成内容,例如,一分钟的生成视频可能仅需十元。这是我们的期望,也是我们目前努力的方向。
Q:现在的视频图像既有拍摄出来的,也有生成出来的。未来你觉得生产的比重占多少?
中科深智 创始人兼CEO 成维忠David :
在一些竞争激烈、价格压力较大的领域,比如电商,我认为未来的发展空间已经不多了。即使再拍摄,也要求成本尽可能低,可能仅几十块钱就能满足需求。我预计未来市场上,一分钟或30秒的视频生产成本应该会在几块钱甚至更低。我所说的生产成本,是指制作而非剪辑。按照这样的价格预期,未来整个市场格局可能会变得更加清晰。但是,在一些领域,比如制作短剧,可能还需要实地拍摄,尤其是需要演员出镜的情况下。
Q:AI视频需不需要创意?
井英科技 创始人兼CEO 朱江:
在面向用户的内容创作中,创意与技术同样重要。技术路线的多样性,如一致性、质量和可控性,其优先级取决于目标用户的具体需求。因此,技术的发展方向与创意紧密相连。
我们团队汇集了多次获得ImageNet冠军的专家和UCLA毕业的商业及文艺片导演,他们共同参与模型的设计工作。我相信,AI生成的内容将逐渐在各个领域成为主流。拍摄艺术与AI生成的关系,可以类比传统油画与摄影的发展。它们最终将发展出适合各自内容领域的独特场景,并可能长期共存。
Q:未来我们所看到的视频将会是生成为主还是拍摄的为主?2024年在视觉领域有哪些新技术值得期待?
智子引擎 CEO 高一钊:
我同意成总的说法,对于一些对真实性要求极高的新闻类或相关行业,生成内容可能不太合适。因为生成的内容往往是虚构的,难以保证传播的真实性,这在这些领域是不太现实的。但对于其他一些偏文娱或电商类行业,我认为生成内容可能会逐渐成为主流。这是我支持成总观点的原因。
关于未来的展望,我认为在视觉方面,像最近国外团队开发的large vision model是一个很好的起点。除了他们,世界上还有许多学术团队在尝试,探索除了大语言模型之外,是否还有其他模态可以实现类似的突破。
尽管目前large vision model还没有给出强有力的结论,但我认为到2024年,在这个领域肯定会有很大的机会。如果有人能够探索出一种新的技术,不仅仅是用vision transformer,而且能够将视觉理解或生成的能力提升到一个新的水平,这也是很有可能的。
无界AI 联合创始人兼CTO 张飞彪:
作为CTO,我对技术发展的洞察是,传统上扩散模型在内容生成领域占主导地位。然而,随着DALL·E 3的出现,一致性模型的使用变得更加普遍。虽然具体细节尚未公开,但普遍推测它采用了一致性模型。
因此,我预计到2024年,一致性模型的应用将更加广泛,模型推理速度也将显著提升,当然可能也会出现更加优秀的模型架构。此外,我们正在利用一些底层加速技术,如TensorRT、LCM等,以优化推理速度。
在视频领域,以往的挑战主要集中在一致性、时长和清晰度上。我相信到2024年,这些问题将得到极大改善。我期待视频生成技术变得更加成熟和稳定,我们也将致力于相关产品化和商业化的推进。
Q:AI Native公司怎么看待跟大厂之间的竞争?
LibAI人工智能实验室 联合创始人 曹仁奕:
像我之前提到的,我们应该从自己擅长的领域切入。一旦大型企业介入通用的底层工具市场,我们就很难有立足之地。例如,通用的视频和图像处理工具可能会削弱我们的竞争优势。因此,我们需要专注于自己擅长的领域。在尝试不同行业之后,我们可能会发现某些领域特别适合我们的产品。我们会不断迭代技术,以满足商业需求,并不断扩大我们的影响力。

来源:非凡产研 · 腾讯新闻。文章中的“非凡产研”是原始发布账号署名,不代表已核实个人执笔作者。引用访谈或圆桌观点时,应按正文标明具体发言人及当时身份;无法确认时不要推断。日期为原始发表日期,历史信息以发布时点为准。

阅读原始发布版本 ↗
← 返回研究文章库