---
title: "非凡大赏 | AI多模态：从单模态、多模态到富模态"
id: "20250522A08J7W00"
publicationAccount: "非凡产研"
originalPublishedAt: "2025-05-22T19:11:21+08:00"
canonical: "https://ffcap.cn/research/20250522a08j7w00"
source: "https://view.inews.qq.com/a/20250522A08J7W00"
sourceAccount: "https://news.qq.com/omn/author/21759984"
language: "zh-CN"
tags: ["非凡大赏","智能制造","营销增长","全球化出海","具身智能","电商零售","AI 视频","流量与用户增长"]
---

# 非凡大赏 | AI多模态：从单模态、多模态到富模态

文章中的“非凡产研”是原始发布账号署名，不代表已核实个人执笔作者。引用访谈或圆桌观点时，应按正文标明具体发言人及当时身份；无法确认时不要推断。日期为原始发表日期，历史信息以发布时点为准。

2025年4月18日，由非凡资本领衔主办，霞光社、给力讯息、云赛空间协办的「生成式AI商业高峰论坛暨第六届非凡奖颁奖礼」在上海漕河泾万丽酒店圆满落幕。

此次盛会吸引了超过80位AI领域的演讲嘉宾和千名AI相关从业者参与。通过主题演讲、圆桌论坛、互动展览和晚宴派对等丰富多彩的活动形式，非凡资本为参与者打造了一个全面而深入的AI行业交流盛会。

![非凡大赏 | AI多模态：从单模态、多模态到富模态 · 原文图片 1](https://inews.gtimg.com/om_bt/OOByOFL6Ge7Y_86zpNKAInoL8VlfPgSMilrOJH7sQGQMMAA/1000)

本场圆桌会议以《AI多模态：从单模态、多模态到富模态》为主题。主持人是非凡资本 合伙人 赵亮，嘉宾包括：帝视科技 董事长 高钦泉Kevin、橙果视界 创始人兼CEO 刘昆Leo、米菲图 **CTO** **钟卫、DeerAPI 创始人 李京林。以下是圆桌讨论核心内容：**

1\. AI多模态技术发展趋势

· 技术演进：AI技术正逐步从单模态向多模态、富模态发展，涵盖文本、图像、声音、3D视频等多种模态，甚至整合触觉、听觉等富模态形式。

· 行业需求变化：随着技术演进，各行业面临重新定义用户需求及商业模式的挑战，多模态技术为解决复杂问题提供了新途径。

2\. 多模态技术在工业领域的应用

· 工业检测：多模态技术提高了工业检测的准确性和效率，通过结合多种感官信息解决单一模态无法处理的问题。

· 智能生产：在产线中引入具身智能，减少人工干预，提高生产效率，特别是在封闭场景如工厂中表现出色。

· 未来展望：计划引入更多模态信息，进一步提升工业生产的智能化水平。

3\. 多模态技术在营销领域的应用

· 营销效果提升：利用AI技术提升广告和内容营销的效果，通过批量生成和测试找到转化率高的内容类型。

· 高质量内容生成：专注于生成高质量内容，满足品牌方对内容的高要求，提升品牌形象和用户粘性。

· 降本增效：AI技术实现内容生成的降本增效，提高营销活动的整体效率。

4\. 电商与出海营销的多模态实践

· 生产端改造：通过AI技术缩短生产周期，提高生产效率，减少库存积压。

· 商品端优化：利用AI进行商品趋势预测和设计，提升商品的市场竞争力。

· 营销端创新：通过AI视频快反抓住脉冲型流量，提高用户获取和转化效率。

· 技术挑战：多模态技术在电商与出海营销中面临持续一致性、多模态对齐等难题。

5\. API聚合平台与多模态技术普惠化

· API聚合服务：提供一站式调用全球各大模型API的服务，降低开发难度和成本。

· 快速迭代能力：支持新模型快速上线，为开发者提供最新的AI技术能力。

· 标准化接口：推动MCP等标准化接口的应用，促进AI技术的普惠化。

· 未来生态构建：认为MCP将成为标准接口生态，提高AI效率，促进AI与AI之间的交互。

6\. 多模态技术的挑战与未来趋势

· 技术挑战：多模态技术面临数据标注、模型训练、持续一致性等挑战。

· 未来机遇：随着技术的不断进步和应用场景的拓展，多模态技术将在更多领域发挥重要作用。

· 行业影响：多模态技术将深刻改变各行业的生产、营销和服务方式，推动产业升级和创新发展。

**嘉宾自我介绍**

**赵亮：**我是来自非凡资本的赵亮。我们今天这个趋势圆桌的主题是AI多模态，从单模态、多模态到富模态。今天非常荣幸邀请到四位嘉宾，是在这个领域里面有非常丰富经验的四位嘉宾跟我们一起分享。因为这两年大家也都知道整个AI行业呈现了两个最基本的特征，一个是大，一个是多。大模型的参数也在不断的突破一个极致。在模态这一块，从单一的文本到图像，到声音，到3D视频等等，甚至叠加了触觉，听觉等等这种富模态的形式。在这样的技术演进背景之下，很多公司可能都面临着重新定义用户的需求，以及商业模式落地等等不同的一些挑战。所以今天我们就围绕着这一话题，大家一起来开放的讨论一下。

**高钦泉：**非常感谢邀请。我是帝视科技的董事长高钦泉。原来是在英国帝国理工大学留学，博士毕业后回来做了帝视科技。现在是进入到第九年的创业。所以经历了整个完整AI，从我们的深度学习，早期可能以生成CNN到生成对抗网络，再到现在的以stable diffusion这些大模型为代表的这种AI的整个流程。所以公司的话目前其实有两大业务板块，一块的话是用AI技术在工业检测，包括工业的具身智能这一块在做一定的探索。另外一块的话是现在跟我们的AI机器的结合。现在在海外的话现在也有多款产品。其中，Picma目前有千万级的用户。大概每天在我们平台上处理的影像有超过了100万张。其实影像这一块市场的竞争还是比较激烈。所以我们的核心在影像修复，包括高保真的人像生成这一块是做的比较深入。所以也打开了很多差异化的竞争。目前整个团队是在快速的发展。所以今天很荣幸能够跟大家进行交流，希望后续能够多多合作。

**Leo：**跟高总相比，我们算是创业小兵，非常年轻，我们团队前身是诞生于开源社区的AID Lab，是一个全95后的创始人团队。包括刚才提到的Stability AI，它的前核心成员现在也是我们团队的董事兼顾问，所以我们算是从技术出发，然后一步步摸索到底生成式AI在当下的时代，有哪些场景是真正能够去降本增效或是赋能。我们从2024年开始，专注到AI加营销这个领域。目前我们也服务过一些像LVMH，安踏这样的一些大的跨境电商和国际化品牌。同时我们自己的产品photo g.art也一直在做多模态的生成，用一个好的交付结果去直接给到用户，能够去完成他的闭环增长。目前我们photo g.art在海外也有了数十万的注册用户和每天大概几万的日活。我们的展位就在门口，等下大家可以深入了解一下。我也非常希望能够跟大家一起讨论一下，到底什么样的落地场景是真正能够去把生成式AI去落到实处的，谢谢。

**钟卫：我是钟卫，我们团队算是电商领域的老兵了。我在外企微软做了十年技术，投身电商行业也有 12 年时间。在电商摸爬滚打这么多年，我们一直希望探索一些新的模式。目前我们的业务主要围绕几块展开，其中之一是我们最熟悉的出海类电商业务。从选品、营销到销售，我们致力于提供完整的解决方案，一切以结果为导向，在这个业务链条的头部环节，我们都积累了丰富的经验。另外，我们也密切关注产业内的变化。生产端就是我们重点关注的领域之一，我们与很多企业有过深入合作，像李维斯、阿迪、耐克这些知名品牌。我们深知，在整个产业运作中，单纯依靠销售环节的模型是不够的，生产端的改造至关重要，只有将生产与销售等环节紧密连接起来，才能实现产业的高效运转。**

最近，我们把目光更多地投向了营销端。随着内容产出、视频模型等相关技术的不断涌现，营销端的迭代速度越来越快，这也为我们带来了更多的机会。目前，我们已经与阿里、一些蓝标企业等众多客户开展了丰富的营销类合作项目。希望紧跟中国企业出海的大趋势，努力将前沿的应用技术融入到实际的解决方案中。

**李京林：**大家好，我叫李京林，我也是在电商、出海营销领域干了大概有十年了。之前是做电商创业，还有跨境营销、出海营销。近期的话，我们做的一个新产品是在AI这个赛道上。Deer API它是做全球的AI大模型的API的聚合平台。我们大概现在整合了全球能叫得上名的大概五百多个。我们说的各种各样的大模型，还有的模型的API全部集合成了一条API。我们提供给非常多的出海的应用来使用我们这个API。我们有一些优势，第一个就叫easy。Easy就是我们可以无缝的去调用全球的我们已知的这些知名，比如OpenAI，包括一些我们通过技术上实现的midjourney sono这些API。然后你也不用看他们的文档，可以非常快的可能在十分钟内就可以实现了整所有的模型的调用。第二是我们的非常的cheap，我们可以做到基本上所有的模型官方价格的7折的调用，调用起来也非常的快速，非常的省心。第三个就是fast，我们全球调用包括最新的模型，可以做到隔夜上新。我们用户可以很短平快的使用上新的模型，不用再考虑你的账号是T2还是T1，包括现在特别火的GPT-4o生图，从我们这调的现在特别的多，我们是通过一些技术手段能实现的，把API供给我们的用户，大概是这样。

**AI从单一到多元的融合与应用**

**赵亮：**听了四位嘉宾的介绍，其中有三位他们的产品跟营销这个行业多多少少都有一点关系，接下来有两个问题。第一个问题是在整个技术演进的视角下，从单模态到多模态再到富模态，大家认为这个技术落地，它最核心的意义是什么？再结合大家各自的行业来看，这种技术演进，如何重新定义用户的需求，以及设计整个新的商业模式。

**高钦泉：**我觉得整体是从单一的模态到跨模态到多模态，是一个必然的技术趋势。我们原来早期一直在专注做图像，包括图像的检测，包括图像的生成赛道。它在解决一些用户问题的时候，其实会发现你用单一的模态是无法去解决一些特定的问题。比如我们在工业检测，原来做了很多像光谱电池片的检测，包括很多跟逐加工里面的逐条的缺陷检测，用图像是没有任何问题。但是后面遇到比较大的蛋品的这种禽蛋的赛道的时候，有时候要去检测这种鸡蛋的裂纹。鸡蛋裂纹用特殊的光谱去识别是没问题，但是遇到鸭蛋的情况下，很多裂纹是看不出来的，我们也陷入到这个技术的难点里面，后面去想想我们能不能突破这个单个图片的这个模态，用其他的模态去解决问题。后面找到了敲击的方案，就是通过敲击以后，听到这个鸭蛋蛋壳上面发出来的声音。然后去判断他的音频的变化，可以精准的发现蛋壳有没有裂。就是从客户的需求去出发，我是觉得是这个非常重要的，一定要符合我们未来的这个用户的需求。

另外，从整个产品来看，就是多模态化其实可以解决很多的未来用户的便利性问题。我们的picma上面上了很多非常实用化的AI的功能。包括大家平时拍集体照，可能眼睛闭上的，那过去可能要很复杂的操作，把眼睛睁开，现在一键开眼。原来可能需要参考图来开源，现在一键开源。未来的话我是觉得做AI修图的话，可能是修图智能体会是一个非常重要的一个方向。因为很多年龄大的一些人员，他其实去操作很多复杂的按键功能的话，可能不懂。但是你让他丢一张图片进去以后，让它去做你想要的事情，通过语音的方式去驱动一些影像的生成。我觉得接下来是一个非常重要的方向。以后大家打开APP想要处理的任何一张照片，专业级的话就输入一张照片。你用文本或者用语音的方式就可以驱动它去帮你完成这个任务。所以我觉得修图的智能体是一个很好的多模态的方式。同时我们在我们的应用上面也不只是做原来的图像视频，包括图片视频到文生视频这一块都有很多结合。所以从整个技术演进来看，我是觉得，一个是从用户的需求出发，我们怎么去更好的去做出产品，能够符合用户的需求，让用户能够方便的使用，非常便利的去使用。从我们原来可能大量的覆盖的是一些年轻的群体，或者说对技术有一定门槛的一些群体。因为现在的人口老龄化非常高。如何能够让我们家里的父母能够打开你的软件，能够快速的修某张图。我觉得这个未来的赛道是很大的。所以从客户的需求出发，然后从用户具体的应用场景，不要被思维局限所限制。可能原来觉得只能用这个方向，有时候发现用多模态的方式确实能解决问题。包括在医疗里面，你要找到bell marker，其实也是要通过不同的模态的数据去融合。所以我觉得多模态是一个比较好的发展趋势。

**Leo：**首先我觉得多模态这个词儿，好像大家最近半年好像都没怎么听过了。因为在AI领域好像是隔一段时间会有一个具有统治性的词儿。我相信在这半年肯定是agent或者智能体这个词在统治着我们的新闻，或者我们对于AI热潮的认知。但具体什么是agent，其实我们给我们自己的产品的定义为基于大语言模型自主规划的多模态内容生成agent，这是我们给我们自己产品的定义。所以本质上其实智能体背后看你想要做什么样的智能体。所以回到多模态这个概念，我觉得首先得思考清楚。刚才您的问题可能是落地相关的，那我觉得也思考清楚大家为什么要做多模态，做多模态意义是什么？因为我们的初创团队里有几位是前stability AI出来的。大家有做图像的，有做3D的，最后怎么把大家攒到一个局里，就为什么我们要做多模态？实际上是我们在跟市场，在跟客户去碰的时候发现，其实客户买不买单，或者就是这个东西落不落地，这个技术落不落地，对于B端客户来说有个很重要的概念，我们认为是叫交付节点。我们一定要达到客户的某一个交付节点，他才愿意很快的去买单。

比如说传统的品牌方做内容加投放这个事情，他整个一套都是交给一个外包团队或者agents，或者一个第三方来帮他做。那你突然告诉他说我能解决你其中的一个部分，但是其他的你还得给agents来做。实际的交互过程中，我相信大家肯定都知道。这供应商怎么算，怎么切换？这具体的问题会导致他最终可能推进的落地的艰难，阻力非常多，所以也是我们自己在和B端客户和一些可能付费能力比较强的这种需求很大的客户中碰出来，发现大家都在期待更好用的AI大家对于更好用的定义是能够去解决他们一个交付节点的闭环。我们再去深入看，它的交互节点到底是什么？我们发现他们需要的这个技术的背后的能力，可能有视觉理解的能力，需要有视觉理解模型的参与，或者我们如果说做一个端到端模型，那就是视觉理解模块，那也需要视觉内容生成，内容的生成可能需要为了保证最后的准确性。那这个模块中可能需要形体的准确性，那可能需要它的3D信息，需要他的位置信息，需要他的光照信息。做着做着发现最后原来我们做的这个事儿叫多模态。我觉得这是我的概念。我们发现多模态最终是真的能够去很接近客户想要的闭环的交付节点的。所以我觉得这个事儿我们也会一直持续做下去，或者为了满足那个交付节点，我们也会把这个模态可能会做的越来越丰富。当然它有多丰富取决于这个产品的定义。像我们会聚焦在可能内容营销这个领域，像可能像manus这样的通用型智能体，它可能会越来越复模态。对或者说具身智能这样的应用场景，我觉得这个可能是隐藏在智能体这一波热潮之下，真正很有价值的这个技术的一个方向。

**钟卫：我们看待多模态，感觉这词太偏技术了，客户往往理解不了，所以我们也叮嘱团队，以后别老跟客户讲这类术语。我们更关注业务层面，期望借助 AI，在原有业务基础上找到解决实际问题的新办法。拿电商来说，库存问题就是个老大难。当前，国内电商仓库里积压着大量货物，约有百分之六七十的商品滞销。所以，甭管 AI 是单模态、多模态还是其他什么形式，最终目的都是要解决问题。具体而言，就是看能否提前对商品进行精准预测、创新设计，通过制作营销视频，在现有流量渠道中进行测试，实现提前预售。就像京东 618 大促前，预售订单通常能占到 40% - 60% 的比例，大家都不敢拖延，毕竟 618 这样的购物节点，要是等一个月才等用户下单，根本行不通，到时候吃亏的就是经销商这些实实在在做买卖的商家，他们处境艰难。因此，很多品牌都渴望看到新商品、把握新趋势，通过计算推理来提前布局。这样一来，我们就能利用模型实现用户下单后再进行生产和销售，这和传统模式截然不同。**

再讲讲商业拍摄。大家可能不太清楚日常电商的上新规模，普通电商一天上新 200 到 300 款商品，那 SHEIN 呢？高达 5000 款。有时候，这边图还没做完，人家那边衣服都已经生产出来了。这就引出一个关键问题：AI 能否调教到既能保证商品产出速度，又能确保质量上乘的程度？在这个过程中，图片生成、优化、后期处理以及基于图片快速生成视频，这些都是基础操作。但目前，现有的模型根本做不到这些，都得依靠人工大量训练。我们曾与 SHEIN 合作，跟进了将近五十多个后期工作室，只为做好一个后期环节，每天要处理五万多张图片。只有做出成果，行业才会买单，否则一分钱都赚不到。所以，这些技术只要能真正落地，客户肯定愿意掏钱。道理很简单，以前工人可能要花 20 分钟才能解决的问题，现在几秒钟就能搞定。但这背后的付出巨大，比如模特图展示，大家都想看到商品穿在模特身上的效果，这种需求能在 B 端市场实现吗？根本不行。从 2022 年底到 2025 年，一直存在货不对板的问题，哪怕花纹、色差有一点偏差都不行，因为用户可不会跟你客气，不满意就退货。然而，这种模特图展示在东南亚的 C 端市场却很火爆。当地模特觉得每天换衣服太麻烦，直接用模型替换，看似荒诞，却实实在在成功了。由此可见，不同行业情况差异很大。我们一直致力于探索能否转变模式，给用户带来眼前一亮的体验，让他们不再为存货发愁，同时实现新品一开发出来，就能提前两个月完成销售。我们现在能支撑 SHEIN 一天完成 500 套服装的拍摄和后期制作，靠的全是模型技术。在我们看来，多模态技术本身并不关键，关键是能实实在在发挥作用。市场上的模型众多，但真正实用、能达到专业级别的却寥寥无几。我们是做解决方案的，之所以不做通用型工具，是因为通用工具很难在专业性较强的行业中提供专业级的服务质量，所以我们选择专注于打造解决方案。

**李京林：**我们现在所在的角色也有一些自己的感受，就是多模态这件事情。因为我们正好是介于模型层跟应用层之间。最近一个月的感觉就是像刚才钟总说的，其实用户侧并不关心什么是多模态。其实早期的卷都是卷在应用侧，他需要去理解每个模型的功能。然后各个厂商其实是当时是分工是有明确的，比如OpenAI他就比较擅长生文类的，当时的Gemini也是这样，生图的可能那个时候是midjourney，stable diffusion这一类的。但是你看看最近一个月我们就很忙，每天因为每一家模型层都很卷，每一家都在更新自己的这个能力跟版本，然后相互开始穿插，模态和模态之间已经非常模糊了。文生图、图生文、图生视频。像Gemini最新的要求是能识别视频，等于是要分析视频返回来。那midjourney又出了V7。来去做一些更新的对抗。你会发现整个的模型层其实为了多模态做了非常多的穿插。我们能感受到就是模型层对于脱光还卷，那其实对应用层也是利好。以前都是需要应用层做很多的调度，去理解很多。可能未来的话逐渐的卷到后面，应用层的多模态的能力就会越来越强，他可能只是产品层的一个调度，我感觉整个行业对于用户来说是非常普惠的。成本是越来越低，模态会越来越丰富。然后越来越趋近于不要钱的让用户去使用的这种状态，这是我所在的这个环节的感受。中间层，API这个层。

**一对一提问**

**赵亮：**谢谢。接下来针对每一个嘉宾提一个比较针对性的问题，大家可以开放的交流一下。首先先问Kevin，因为Kevin他们有一个产品叫picma，我们非凡产研监测到picma的数据还是非常不错的，最近半年涨势保持了一个相对稳定的增长。但是今天我们就不聊picma了，我们可能更关心帝视科技在工业场景中，应用整个多模态的能力。所以先请Kevin跟我们分享一下，帝视科技在工业视觉检测这个领域，有哪些比较不错的实践，以及在动态融合这一块，是如何能够解决一些传统的多模态无法解决的痛点。最后，未来是否有计划引入更多的模态，比如触觉或者是听觉之类的。

**高钦泉：**其实刚才前面嘉宾我感觉都说的比较好，就是单模态多模态不重要，最终还是以解决用户的痛点，包括用户是否买单，为我们判断的依据。从我们现在做的工业视觉的赛道来看，应该说工业检测，现在是一个非常卷的一个赛道。基本上在很多细分的行业里面都有很多竞争对手在那边。但现在遇到的，其实我是觉得还有很多没有突破的一些应用场景。比如说像布匹的检测，在布的这个环节里面，你到现场去看，会发现他一条线可能会做各种各样的布的原材料。所以你要用一个算法去检解决所有的布匹检测不现实。所以过去除了无纺布前面原材料环节可以做成单一的产品。但是到后端以后，你会发现没有一家公司做成功。因为它面临的就是可能有成千上万的布匹，它的花纹、它的颜色、它的质地。你用一条线上去解决它所有的问题是很难的。但是现在的整个大模型的发展给了我们一个比较好的启发，就是能不能去用大模型来解决。现在这些工业流水线上，它可能是生产不同批次的产品，就又是一条线。这样子的话，从目前的机器人来看，他现在的视野是可以识别到各种各样的物体。他学的数据越多以后，对物体的识别检测的能力是越强。像过去我们要去做某个物体的检测识别，一定要走的路径是对数据的收集，数据的标注，包括缺陷的标注。其实这个环节就决定了你只能在当前的数据下面去解决现有的缺陷检测。

那未来有没有可能，我们现在用大模型的技术，像刚才说的，布这个环节只是其中的一个。现在还有大量的一些产业里面，其他一条线上是做多个品类的，现在还是人工在在检测。如果说能够突破在一条流水线上各种物品的整个智能化的检测的话，这个市场我是觉得还是有个很大的机会。这里面可能刚才说了，从单一模态到多模态，但更重要可能从大数据跟大模型的角度去解决问题。另外我们现在也在做，因为在光伏的赛道里面我们做的很深。现在跟光伏的厂家去聊，其实产线上的那些智能化的检测基本上都有，就是这边的功能已经都解决了。但是在产线里面还有很多负责运维跟生产的功能，一条线上面还有几百人。那现在的这个具身智能，我觉得在工厂的应用场景是非常大的。在生产跟运维环节非常重要，因为它是一个封闭的场景，不像我们的家庭的机器人，他要去服务于家庭的各种各样突发的情况，或者说家庭可能走路还是一个问题，就是有台阶各种各样。但工厂它是一个纯封闭的场景，用轮子就可以去解决。

另外的话，每个工人他每天上班做了哪些运维的事情，生产的事情，其实他的这个范式是固定。所以如果说我们能够往整个光伏生产运维，包括过程的具身智能去做的话，我觉得接下来这个落地应该是非常快的。因为这里面大量的人员，目前是从企业的角度来看，他养这么多人是保证有订单的时候没有问题。但是一旦订单，如果说像光伏这几年是跟波浪式过山车一样的发展，养了太多人以后，对它成本是有很大的压力。所以如果说用我们的具身智能能解决产线的生产跟运维问题的话，对他一个很大的一个帮助。这个里面的话就需要大家去不停的去往细分方向，一定从细分方向一个点，比如说你就从光伏的生产线做，他成功了以后再复制到各个地方。最终到家庭的机器，我觉得这条路径还是比较久。另外最近也有在说，现在我们人工智能这么智能，把很多人的工作给做了以后，未来会不会造成这个社会的就业问题，造成社会动荡的问题。其实我也一直在思考这个问题。就是过去的话，其实从我们的蒸汽机时代到我们的计算机时代，包括信息化时代。那时候每一次的工业革命，其实他做了一件事情都都没有把人给替换掉。人只是说去驾驭了这些新的技术，让它的生产方式、生产力发生了一个更大的一个提升。但这一波的人工智能就不一样了，大家没发觉到有些工作不需要人。人被替代掉。所以他对我们接下来的就业是会造成一定的影响。所以在国家的制度层面，包括这个政策层面需要去干预，不然会造成很多人确实找不到工作。包括无人配送，包括无人驾驶为什么会去限制，会有这个原因。所以在最终的话，我是觉得不管任何企业，就是以客户的需求为出发，单模态多模态大模型只要能解决当下用户的这个问题跟痛点，它都是一个好的路径。

**赵亮：**谢谢Kevin。然后是橙果视界的Leo，因为刚才听leo的介绍，感觉橙果是一个非常全球化的团队，从股东的结构到团队的主要核心成员的背景来看。所以我这边有一个问题特别想跟leo交流一下。去年我不知道大家有没有听过一家公司叫做applovin。去年整个美国的资本市场最受关注的一家科技公司，不是英伟达，也不是微软，也不是谷歌，而是applovin这家公司。Applovin这家公司去年一年整个市值翻了七倍，他是做广告、做营销的一家公司。他在开这个投资人会议的时候，大家问他为什么业绩的提升这么快？他把这件事情要归功于AI能力的提升。他说他们在23年的时候推出了一个AI的引擎，能够有效的帮助客户提升广告的效果，还有营销的效果。所以能够让他在24年的时候整个业绩翻了好几番，然后整个利润率达到了50%多。我不知道leo总会怎么看，因为我感觉leo应该也是听说过这家公司，而且橙果视界也是在营销这个领域，所以就希望leo跟大家可以分享一下，一方面对applovin的看法，另一方面橙果视界这边是如何帮助客户来提升整个营销效果的，有没有一些最佳实践能够跟大家去分享一下，谢谢。

**Leo：**这个确实我也听说过，我记得他好像是都快退市了，就市值非常低，跌到了90%，后面又回来又翻了七倍，所以算是一个神话吧。而类似其实ai时代这样神话还蛮多的，但我觉得集中在两个点。有一个很类似的公司其实叫boat new，我不知道大家有没有听过，是一个用自然源prompt就可以生成一个网站这样的公司，他做一个传统saas软件，也快要不行了，突然之间他做了这样一个新的形式，去新的飙升。我觉得这种确实我觉得从现实实际的案例我们能看到生成式AI先不说对于行业，对于某几家公司，它确实是一种逆转的形式。那这个点我觉得其实基本上现实案例已经做了很好的证明了。第二个点就是评价这家公司，我觉得我可能还没有那个能力，我也不敢妄自评价了。但我觉得我们做的方向其实不太一样。但总的来说我觉得我们在focus在营销这个事情上，我觉得很核心的两个点。一个是我觉得是大家不管做不做内容营销，内容是非常关键的。另外一个点就是流量。在内容方面，就是内容的质量，内容持久度等等。流量无非就是获取流量的渠道，流量的价格。比如说别人可能用十块钱获取一个人，applovin在流量这一侧其实做的蛮多的，可能他能帮客户用一毛钱去获取你可能需要用100块钱才能获取的流量。所以我觉得集中在这两个层面。

生成式AI其实在这两个层面都可以有很好的表现。我们自己更擅长的点，或者我们橙果世界也好，photo g也好，我们更关注的点是用技术去得到降本增效，速度增加等等的同时，去得到一个很高质量的内容。这个也是为什么我们会选择跟一些大的品牌方去合作。比如说像LV，像开云这样的大的国际化客户。因为他们对于内容的要求是非常高的。我们跟他们合作也算是证明了我们在内容方面的一个水准。高质量的内容是非常重要的。比如说我们之前有跟有拆解过一些失败的案例。比如说可口可乐用AI做一条广告片，结果导致整个品牌形象暴跌。其实很多品牌方不知道该怎么用AI。他们怕有一个很诡异的现象。我觉得大家可能也面对过，就有一些客户明明在用AI，但是不敢去公开承认说我是用AI在做的或者怎么，其实会有这种比较普遍的现象，所以内容非常重要。我们服务的某一个耳机的品牌，它以前在亚马逊上做到了当类目的第一。后面转DTC开始做自己的独立站，然后发现怎么都打不下去。我觉得AI的技术，一方面能够去给他做更好更快的内容，这个快我觉得并不能核心解决问题。我觉得比较重要的我们做对了一步是我们给他去生成了各种各样的内容。当然我们也做了诊断，比如说年轻化不足，比如说可能对于一些美国地区的不太友好。但具体是什么样，其实营销这个环节很多时候都是未知数。我觉得比较重要的一个点是我们能够去批量生成可能1万个标签的内容，然后再批量的打下来做测试，然后我们发现哪一个类型的转化率是高的，这是一个很随机的事件，这个都不是通用的。

对于不同的品类在不同的地区。比如说我们另一个客户，他在全球七十多个国家地区，每个国家地区它都大概有3到4个平台。又是亚马逊，又是wayfair，又是temu，又是shein，他都要去投放自己的品。这种复杂程度，每一个国家地区，每一个品的客户的这种对于内容的喜好又不一样。我觉得这个可能是除了我们通常意义理解的AI的这种多快好省以外，它更大的一个价值。真正去对于我们一直都在讲全球化品牌出海的全球化营销，在讲的一个叫做品牌在地性，去消解这种品牌在地性的不确定性。我觉得这个可能是我们在这个方向切到的一个小点，我们也希望把这个小点真正做到最好。另外一个就是流量，流量的事情我觉得我们做的不是很多。现在有很多其他的工具，在流量这一侧做的会更好。在内容和流量上面，生成式AI是能把一个公司从濒临退市到市值涨七倍。对于很多一些品牌方和电商或者所有类型的公司，也都会有这种起死回生的能力的。我很坚信这个事情。

**赵亮：**谢谢Leo。然后接下来就是米菲图的钟总，因为钟总是技术背景，技术能力很强，希望钟总跟大家分享一下，在整个生成式多模态技术视角下的一些挑战。另外，在跨模态的内容生成这一块，我们看到有一些大家普遍在讨论的技术挑战，比如持续一致性，或者多模态对齐等等的一些难题。

**钟卫：**我觉得我们遇到的失败案例是比较多的。我们总结下来，在客户这边就是几条线。一个是在生产端、商品端以及在营销端的改造。目前我们逐渐爬到营销端，很多坑我觉得过去了。我举几个例子，大家可能看到我现在穿的这条牛仔裤，很多东西在这个节点上会出来，它不一定只是我们现在看到的这点算法，平台和这些技术，其实它在深刻的改变整个生产端。比方说这条牛仔裤，像李维斯这样的客户，我们拆解一下。我们差不多在美国三藩那边待了将近几个月时间。从纱线开始踩，大概七百多种纱线和不同的布。每个纱线我们都要去做放大，对所有的纱线去做拍照、分析、数模、数字化，以及做它的整个纹理结构。最后通过数字化的东西把它还原成要去做的纹理。

这里面呢裤子分几层，底层是纱线，它有横纵经纬。接下来是我们所说的颜料印染。然后是高锰酸钾褪色，不同的褪色时长。再往下是纹理，它有斜纹，不同的斜纹，纹理的话要印上去。接下来是看到上面的一些手抓、雪花，还有毛须的效果，都是手工喷涂的。然后是到一些图案，再往上才是缝制。一共6到7个模型，做一条牛仔裤，手工正常一个月的时间。因为牛仔裤是手工品，如果按照李维斯正常去做一条牛仔裤，半年开发一条牛仔裤。如果说把这几个模型，通过对所有的内容工艺，原料完成采样。再将白胚打印完成之后，直接切彩片就可以了。差不多一周直接交付客户，再加上三到十天的时间可以寄到美国客户那边，半年的时间可以缩短到十天交付。但真正去接生产的时候，你会发现这个东西完全不一样。他不是销售了，你也不是做电商的人了，你其实就是在跟客户一块去做一条裤子。所以我一直在讲会改变特别多的生产行业。比如说配饰也有POD，他们有机床CNC，很多东西都搬到那边去了，不是现在简单的去印个T恤。像牛仔裤一个公司至少卖2亿条。连衣裙将近五六十美金的客单1年可能卖5000万条，一家公司轻轻松松的，这个是真正有壁垒的东西，这是我们对行业的理解。

我们再去讲整个在商品端的东西，商品端尽可能保证没有库存，这是我们的目标。比方说我们给阿迪和斯凯奇去做，用的就是推理模型。我们之前大量的抓数据，然后测，再把数据分析完成之后给客户一个报告，其实这是一个总结性的，没有任何推理的东西，我们的推理还停留在人工推理。现在我们抓数据，原来用一周时间，现在用一天的时间，且推理当天完成。现在真正替代的是什么呢？是买手对于商品的理解。后面是设计师对商品的理解。当我出了这个款之后，我还可以出很多衍生款，设计师知道什么颜色搭什么样的领、袖、口。它的整个的材质，以及这一些里面体现的工艺、刺绣，这些东西是一些排列组合。真正去做衣服的时候你会知道什么是好卖，就是把各种东西叠加一起。比方是说生意卖爆了一个东西，他第一做做事就是把这个衣服变成几种颜色快速卖，这叫衍生，很快就能卖出去，非常简单。那再往下做什么呢？就是拍摄。正常两周的时间，我们能做到两天的时间交付。举个简单的例子，我们之前拍的大码的女装。你知道美国人的臀能到多大？只能找特写模特去拍，拍了之后再去修。这些东西很多AI其实是解决不了的。但是你真正跑了模型之后，你就会知道哪些我需要通过人工还要去拍，哪些我需要去做后期。基本上一个问题都是将近半年多的时间来去做解决，最后才到我们所说的销，我们把衣服穿到人身上，然后在不同的大街上或者一些走秀场去露出，最后生成视频，这时候才变成我们可以销售的SKU。现在我们在干的另外一个部分是在营销端的部分。我们其实在帮阿里去做整个的海外业务的增长，用户的增长。因为简单的说通域的流量没有太多流量，就是大家去投广告费的模式，投手对吧？我一个获客多少钱，但是说实话你真正在去做整个矩阵号，通过内容精准获客之后，获取到这个用户是不一样的。

我举一个最简单的例子，就是关税这事儿。但是我发现像敦煌一波，淘宝一波又把这个舆论搞得特别强。但因为这一波流量，整个的APP下载非常厉害。你知道那个时间点只有将近6个小时的时间，能抓多少波流量吗？非常巨大的一波流量，我们所有的员工在里面拍绿幕拍屏，然后把人抠出来开始讲东西。差不多一下午50条片子出去，基本上我觉得差不多在100万左右流量是有的，新营销的作用是啥？就是快速拿流量。现在的整个流量真的是脉冲型的。那你说人能抓住吗？除非你有准备。你现在想像阿里一样能能抓住，我们就只有能够做AI的视频的快反才行，对吧？半小时一小时之内产出50张片子才行。但这个是有质量的，是有观点的，是有真正有内涵文章的，你才能抓住它。因为现在的用户不傻，尤其像美剧用户，我们前期在投一个美剧，用户真的很贵的。一个点击可能到0.5、0.7，平时你能投到0.3，你内容好的话不花钱的，就是这样子。所以我们才发现这个的核心东西是在于你是不是对整个舆情，真的有感知，有网感。或者说在那个趋势下面你能快速的把你的东西拉出来，去接触这些东西。这可能是我们对于整个营销端、生产端和商品端的一些理解。

技术方面，我们技术做了很多。之前我觉得两个大的改变，一个是叫推理模型。今年我们一直在做整个推理模型。确实DS出来之后，我们觉得这个推理太牛逼了。但这个东西有点自嗨，这个东西还要变成一个行业性的推理模型，像电商一样，它其实有一定目标性的，因为客户本身会为这个事来去买单。比方说你的图修的好不好，能不能过他的营销关，或者说案子好不好，都是按照这些来去做的，所以推理模型所有东西都要去过一个是不是付钱的这么一个标准，这是我们的一个认知。还有一个认知是视频模型。类似于我们戴一个戒指，我们用很长时间把这个戒指先把它戴上。人工P也好，或者把它变成一个3D之后，我们多几张照片，然后再分别去渲染。做了好多种方法。SD出来之后，我们又找到新的方法，但是不精准，就是货不对版。我们最近发现更好的办法就是用GPT直接生成，GPT我们不知道他内部怎么去训练，确实很牛。你带一个水晶手串，就水晶的部分，它每个珠子的光泽以及它的纹理都是对齐的，而且它是可以精准的带到人身上的。我只能说现在我们自己来看，视频模型我觉得会发展挺长的一段时间的。还有一个我觉得应该算是认知模型，就是这个部分我们更多的。还是要去参考类似于自动驾驶这种模式。可能这条道大家没有通过，那我们可能还是需要人去大量的做标注。这个标注不是道路的部分了，而是说这个会场里面都有什么样的人，他是什么样的民族，还有他平时的举动是什么，以及他的身上穿的，然后带的还有背的这些东西。我觉得这个东西其实真正要走到现实里面去了。认知模型我觉得后面会变成非常庞大的一个点，支撑我们现在的整个模型外围。

**赵亮：**好，谢谢钟总。因为时间比较有限，本来我还为各位还准备了一个问题，但是目前看来应该是没有机会了。那么最后一个发言的机会就留给咱们京林了。我给你的问题是就是dear API作为开发者服务平台，如何能够通过标准化的接口降低多模态模型的应用门槛。然后在推动整个多模态技术的普惠化过程中，您认为开发者生态最需要哪些支持？包括最近MCP的话题也比较火，也可以跟大家聊一聊。

**李京林：**我们先说一下dear API现在服务了非常多的开发者跟出海应用客户。我们最重要的是解决了开发者的开发的难易度。以前你调OpenAI也好，调deepseek每一家的API文档都不一样。CTO/技术人员需要到处去充值，还要盯着这个厂商的API有没有余额。那在我们这里面就一站式的充值，所有的API都可以直接调取，这个就解决了开发的调用，非常的easy。新的模型上线当天晚上我们就可以提供模型去服务给的用户。实现了非常快速的迭代。第二个就是我们因为有一定的使用量之后，通过一些技术手段实现了非常低的折扣。比你官方调用，可以至少做到官方价格的7折，甚至更低的成本去调用。第三个就是我们的模型是非常的全的，有一些模型它们官方可能没出API。我们通过各种各样的技术手段来实现这个API的方式，再提供给我们的用户，让他们在chat box、应用层里面实现这个idea，用midjourney来生图，用suno来写歌。

刚才赵总又问的MCP这个问题，我们现在也在努力的开发适配。我认为MCP这个事儿，未来确实是一个大的趋势。可以分四个阶段看这个事。在过去24年的时候，MCP刚出来的时候，我们当时还觉得cluade一定是未来，但未必是MCP。也许别家可能出个类似的接口来跟他竞争，因为当时还是functioncall。那MCP是个进化结果，Open AI也支持了MCP，现在整个生态都支持MCP，因为我自己有做音乐。我刚才在下面听分享的时候，我发现我用的那个宿主ableton，他刚刚今天发布了支持MCP的协议，就说明整个时代进化到了全员支持MCP。这个就成为一个标准的接口的生态。当下来看，我们所有的AI应用层开发者。以前你调完模型的API，比如在第二调API的时候需要去调工具天气类的，你需要functioncall，我们家也是支持这个，第二API是支持这个OpenAI或者claude的这一类。未来是全部走MCP。不需要针对天气也好，订票也好，专门去调他的functioncall。也许他没有提供这个接口，那MCP化了之后，大家都是统一的。这是当下来看，对于应用层的开发变得很容易。但是再往后看一下，其实觉得比较可怕的一件事情。现在通用型的AI Agent大部分用的技术叫computer use。就是去看那个浏览器也好，模拟我们人类，它要去看那些文字，那些东西。但是当前的所有网站，全世界的亿万个网站，都是基于我们人类视觉构建的。上面有文字，下面有布局，下面有美化。AI其实不用care这些东西。未来这些网站全部MCP化了之后，整个AI的效率又会上升一个大的量级。deep research我们现在看很慢，有时候经常断档。像我们支持Grok3的deep research，这个中间可能会出现这个延迟。但是如果这个东西也MCP化的时候，它的效率可能是指数级的上升。因为机器它不需要再看这些文字了，不需要再看互联网的布局，去抽掉那些没有用的H1H2和那些乱七八糟的标签了。它不用care这些事情，这个是非常吓人的。在未来你会发现人类跟他之间的竞争就无法去替代了。

再往后看的话，就是更吓人的一个角色。就是因为谷歌出了A2A ，我们现在在座的五位嘉宾，现在交流了这么多内容，假设我们都是Agent，这点内容可能10秒就全部结束了。未来AI跟AI之间，Agent之间的交互，是多么的吓人。假设一个场景，就是未来具身机器人，现在我们认为它没法去做厨房这么复杂场景，现在的厨房灶台要拧，这不都是基于我们人类的这个碳基生物去构建的吗？那硅基生物它可能不是这样，那灶台MCP一下它就开了。它完全可以定义火候跟温度的，全部是MCP的。所以我觉得再往后看的话，基于MCP构建的世界是其实是蛮吓人的。我本身也在北大读EMBA，我们人工智能老师跟我们讲，就是现在是AGI时代，未来可能是ASI时代，就是增强人工智能。整个世界如果基于硅基生物来构建的话，是蛮吓人的一个状态。DeerAPI在这中间中也努力的去跟上这个时代，我们也在努力的去配合MCP协议去做通用型的调配。未来也可以直接去调用各种MCP的接口直接使用。大概这个是我对当下MCP的一个看法。

---

原始发布版本：https://view.inews.qq.com/a/20250522A08J7W00

本站阅读页：https://ffcap.cn/research/20250522a08j7w00
