---
title: "资深从业者暴论：AI时代“偷”歌的成本比做歌还高"
id: "20251128A04W3J00"
publicationAccount: "非凡产研"
originalPublishedAt: "2025-11-28T15:55:52+08:00"
canonical: "https://ffcap.cn/research/20251128a04w3j00"
source: "https://view.inews.qq.com/a/20251128A04W3J00"
sourceAccount: "https://news.qq.com/omn/author/21759984"
language: "zh-CN"
tags: ["营销增长","商业化","全球化出海","短剧与漫剧","游戏","AI 音乐","IP 与版权","模型与基础设施"]
---

# 资深从业者暴论：AI时代“偷”歌的成本比做歌还高

文章中的“非凡产研”是原始发布账号署名，不代表已核实个人执笔作者。引用访谈或圆桌观点时，应按正文标明具体发言人及当时身份；无法确认时不要推断。日期为原始发表日期，历史信息以发布时点为准。

如果有一天，世界上 99% 的音乐都不是人写的，你还会为一首歌单曲循环吗？

当短剧用上 AI 配乐、电影用上 AI 配音、健身房、瑜伽馆、直播间背后的所有 BGM 都由算法实时生成，音乐这门最感性的生意，会被改造成什么样子？

在2025北京非凡大赏的一场圆桌会议上，我们把这样的问题抛给了四位站在一线的人：

主持人是做了多年行业深度观察的 **范志辉**（音乐先声 & 文娱先声 创始人）；

做全球 AI 配音业务的 **宋开发**（VMEG 联合创始人 & COO），每天在跟印度制片公司、海外电视台一起打磨有人格的声音；

来自多模态大模型公司的 **程昭瑜**（MiniMax 音乐总监），在思考一件事：当文本、视频、语音和音乐都交给同一个模型，会催生出怎样全新的创作方式；

为音乐人和开发者提供音乐模型与 API 的 **郭瑞**（Mureka 增长营销负责人），在第一线感受到商业化和成本曲线的真实压力；

以及同时身兼音乐人和 AI 创业者的 **杨樾**（43AI 科技集团联合创始人 & 43Music CEO），提出了那个颇具争议的判断：**人类应该听到的 99% 的音乐，其实还没被做出来。**

这篇文章不是简单的逐字整理，而是把那一时刻的观点、分歧和顿悟重新串起来，当 AI 开始写歌，音乐产业的游戏规则还有多少是原来的样子？

![资深从业者暴论：AI时代“偷”歌的成本比做歌还高 · 原文图片 1](https://inews.gtimg.com/om_bt/OP7PCpJ7stks3ihFtVqzHY6KnN7IZQW-0wqy3RkwXr4ngAA/1000)

**一. 从播音腔到人味儿：配音行业正在被重写**

先上来的是最落地的业务，AI配音。

宋开发说，他们做VMEG这家公司，专门给全世界的内容配音：短剧、电影、动漫、广告、纪录片。目前已经有一百多万用户，遍布印度制片公司、海外电视台、电影公司。

在全球用户的反馈里，出现频率最高的两个词是：

**Natural（自然）** 和 **Real（真实）**。

传统的AI配音，尤其是很多大厂出的模型，声音普遍像播音主持：标准、清晰、无瑕疵，也无惊喜。大多都只是成年男女嗓音，情绪平铺直叙。

而真实世界需要的声音远比这个复杂得多。孩子、老人、方言、口音，甚至藏族老奶奶这种特别窄的音色，都是稀缺资源。

VMEG在做的事情，用一句话概括是：**在170多种语言上，把声音的长尾补齐。**

不只是能说，还要能说长。

很多AI配音产品，读个几十秒广告没问题，一到长视频就暴露：声音前后音色不一致、情绪突然变调、人物人格崩坏。

而宋开发的客户，大多是拿着两小时电影来测试的。电影里还有歌曲、情绪爆点和大量对话，稍不注意就穿帮。

所以他们把壁垒压在两个字上：**音色** 和 **情感**。

当你能让一个虚拟的声音，连续几小时维持稳定的人格，还能在哭、笑、愤怒、沉默里自然过渡时，配音不再只是听得懂，而是听得进去。

如果你想象一下未来：一部印度电影，可以用北印度语、南印度语、多国语言自动配音；

歌曲部分可以选择翻唱还是保留原声；

所有这些都嵌在制片工作流里，导演只管看结果。

你就会理解，为什么宋开发强调，真正的壁垒，不在会说话，而在懂电影。

![资深从业者暴论：AI时代“偷”歌的成本比做歌还高 · 原文图片 2](https://inews.gtimg.com/om_bt/O8XhsEtPssMUG74JlVJjfh1Z4cNYkz0eIlDRxr5lo0xVYAA/1000)

**二**.** 当音乐失去稀缺性，版权逻辑会崩盘吗？**

如果说配音是在修补原有产业链上的效率洞，那43Music干的事情，更接近于重做一套逻辑。

杨樾的观点很直接：

过去这一年半，大家对AI音乐的看法从高效工具，变成专业助手，再到今天——领先模型已经可以超过绝大多数职业音乐人。

他留了个余地，说还有1%没被超过，是给人类留点尊严，但话里的意思不难听懂：

**AI在创作层面，不再是玩具，而是真正的生产力。**

问题来了：传统音乐产业的价值基础是什么？

很简单：**稀缺性**。

写歌要时间，要经验，要灵感，还要机会成本。

所以一首爆款单曲的版权，能源源不断给创作者带来收益。

但AI让这一切碎掉了。

当模型可以在短时间内大量产出高质量音乐，写一首歌这件事不再稀缺，版权自然也抬不起价格。

你一年写十首歌，其中一首火了，版权养你十年；

AI一天帮你生成一百首歌，每首都还不错，但都没有非它不可的理由。

于是，杨樾提出了一个新概念：**MaaS——Music as a Service，音乐即服务。**

在这套逻辑里，音乐不再被当成一首首作品出售，而是变成与场景绑定的服务能力：

给瑜伽馆的是一整套符合呼吸节奏和肌肉放松节奏的音乐；

给运动场景的是根据心率和成绩反馈动态调节节奏的音乐；

给睡眠和冥想的是能降低紧张感、帮助入睡的声音处方；

给学习和专注的是维持节奏但不过度抢注意力的背景声。

音乐不再是听什么就算什么，而是你需要什么，我就生成什么。

更有意思的是，他们甚至不做严厉的防盗策略。

原因很现实：

做一首歌只要十五秒，

偷一首歌还得花四分钟去转录、导入、清洗。

**在一个生产成本接近于零的时代，防盗本身变得不经济。**

真正值钱的，不再是那一首歌，而是你能否持续为某个场景，提供真正有用的声音解决方案。

![资深从业者暴论：AI时代“偷”歌的成本比做歌还高 · 原文图片 3](https://inews.gtimg.com/om_bt/ORO8mJ1BVtyBQ355vKpo1_4ud8uSfZVk3dTWItjEhaHucAA/1000)

**三**.** 多模态厂牌：为什么还要费力去做音乐？**

如果你是一个大模型公司，已经在文本、图像、视频上厮杀，为什么还要上音乐这个看上去小众又难评估的方向？

MiniMax给出的答案，是多模态之间的共振。

程昭瑜提到：在一个多模态的架构里，文本、语音、视频、音乐，并不是四条平行线，而是很多地方可以共用底层经验和训练框架的。

更重要的是，当模型能力越来越强，边界正在变模糊。

你很难再把这是专门做音乐的模型和这是做视频的模型完全分开，因为一段影视内容，本身就同时包含画面、对白、音效、配乐。

从产品层面来看，他们现在在做一键式创作：

你有一个灵感，一段文字或者一个简单的提示，就能生成一首完整的歌。

对于大部分听众来说，一首AI生成的流行歌和人类制作的，已经很难靠耳朵区分。

真正难的，不是音色像不像，而是两个词：**美感** 和 **独创性**。

美感可以通过大量数据学习，粗暴地说就是：别太难听、别太突兀、别脱离基本的音乐审美。

但独创性就麻烦了。

在理论上，只要你写出的旋律没有在世界上出现过，那就是原创。

然而现实世界里，我们都知道：为什么那么多歌听起来差不多？

因为它们只是在配方上换了几味香料，本质还是预制菜。

MiniMax在做的，是用评测体系去回答两个问题：

一首歌是否符合通用美学，至少不要让人听着难受；

同时是否又能给创作者一种这东西就是我的感觉，而不是一堆套路拼出来的声音模板。

当多模态的能力叠加起来，音乐就不再只是配上去的BGM。

它可以和画面、文本一起被设计，成为整个内容体验的一部分。

![资深从业者暴论：AI时代“偷”歌的成本比做歌还高 · 原文图片 4](https://inews.gtimg.com/om_bt/OLBujGb-0vBSNWQtqXMR7Is68Pg9JfOhsH_8qerH7gZZgAA/1000)

**四**.** 从模型迭代到降价 40%：B 端生意的现实拐点**

聊技术容易兴奋，但所有兴奋，最后都要落回一句话：**赚钱难不难？**

Mureka的回答非常务实。他们一边在做面向创作者的音乐产品，一边在为开发者提供API和模型服务。

郭瑞透露，他们即将更新的 O 系列和 V 系列模型，整体会变得更细腻：

不仅能听懂爵士风摇滚风这种粗粒度风格，还能捕捉慵懒的下午微微心碎但不崩溃这类细腻情绪。

在B端，模型会更稳定、更高速、更易控制。然后是一句非常关键的话：**新一代模型，将整体降价40%。**

为什么？

因为他们发现，接入音乐模型的B端公司越来越多：

做AI视频的，做传统视频广告的，做游戏的，做虚拟偶像的……

这些客户的诉求和独立音乐人完全不同，他们更看重：

能不能稳定输出？

延迟够不够低？

价格结构能不能支撑整个生态赚钱？

如果模型厂商把自己定在生态链的最上游，却把价格卡得很死，下面一圈做应用的人没钱赚，这个生态很快就会枯萎。

所以降价不是做慈善，而是一个冷静的判断：

**当技术跨过某个门槛，合理让利，反而会放大整个市场。**

![资深从业者暴论：AI时代“偷”歌的成本比做歌还高 · 原文图片 5](https://inews.gtimg.com/om_bt/Ot5gU7sUQ-IfYWWiL1chhglgsANOa28ZDYmbNMbwhr-z4AA/1000)

**五**.** 声音的记忆：配音不是替代，而是放大情感**

回到声音本身，它不只是信息载体，更是情感记忆。

最近《疯狂动物城2》在国内因为配音问题讨论很热：观众不是不爱明星，而是不愿意放弃自己对经典角色声音的记忆。

宋开发在海外做配音时，看到了更细致的需求：有音乐人希望用自己的声音唱完全不会的语言，比如希伯来语、立陶宛语；有明星和IP方希望用自己的原声人格，说遍全世界的语言；有学生希望听到熟悉的老师讲各国语言课程，哪怕这些音频是AI生成的，学习体验会更亲切。

这些需求都指向一个事实：**声音是记忆的索引。**

当你听到一个熟悉的声线，大脑会自动唤起和它绑定的情绪。

这也是为什么，不同地区对AI配音的容忍度差异巨大。

在一些拉美国家，观众对AI配音版本的短剧接受度很高；但在北美，很多用户一听出来这好像不是人，就立刻弃剧。

为了让AI声音不穿帮，VMEG在攻克一些看上去很细节，但对体验极其重要的能力：比如AI哭腔，让声音在哭的时候真的有颤抖与破音；比如异口同声，多人同时说话的立体感和空间感；比如未来的会议同传，台上领导讲中文，台下每个人都能听到领导本人的声音讲英文、日文、西班牙语。

这里面有技术挑战，但本质仍然是那句话：**AI不是来消灭人的，而是把人的情感放大到更大的世界。**

**六**.** 创作工具变了，但音乐家这件事没变**

那普通的音乐从业者应该焦虑吗？

杨樾给了一个很不鸡汤的回答：有了AI人人都能成为音乐家这句话，是扯的。

音乐从来都是极少数人的事业。

只是过去的门槛在于技巧、乐理、器乐和制作能力，如今门槛在于另一件事。

**你是不是一个愿意持续学习、不断升级玩法的人。**

AI的出现，只是在拉高整个行业的平均分：

原来只能做80分作品的人，现在有机会借助工具做出95分；

原来能做到100分的人，有机会做到120分。

这个过程带来的一个结果是：**垃圾音乐会被大量淘汰**。

但这并不意味着所有人都没机会了。

相反，它让真正有表达欲、有独特视角的人，更有机会突破。

**程昭瑜说，未来的个人创作者，很可能都是超级个体：一人既是文案、导演，又是配乐师和制片人。**

AI不是在替你写歌，而是在帮你把脑子里的那一闪，以最低摩擦变成完整作品。

只要你有东西可说，有情绪可分享，就永远有机会。

**七**.** 增长的底层逻辑：先回到人，再谈增长黑客**

聊到商业化，话题自然绕不开增长。

但Mureka的观点是：如果增长只盯着数据和黑客技巧，而脱离了创作者和用户本身，最后一定会走偏。

在他们的视角里，有两群主要用户：一群是创作者和音乐人，他们真正的需求叫表达。

他们不一定在乎这首歌能不能上榜，更关心的是：有没有一个足够顺手的工具，帮他们把脑子里的画面变成可以被听到的东西。

另一群是B端客户和开发者，他们的需求不是浪漫，而是可控和稳定。

能不能通过API稳定调用？

能不能保证每次输出质量稳定？

能不能根据业务场景做细致调参？

这里有一个被反复提到的关键词：**Domain Expertise，领域专业性。**

AI不会自动理解一个瑜伽老师、一个健身教练、一家广告公司真正需要的是什么。

必须有一批同时懂音乐、懂产品、懂行业场景的人，把技术翻译成业务语言。

增长不是拉新+转化+留存几个公式，而是你能不能持续地帮这一群人解决实际问题。

**八**.** 给想做AI音频的创业者：壁垒、不复制和放下自己**

聊到最后，范志辉问了一个所有人都在想的问题：如果现在要进入AI音频赛道，你们各自给一句建议，会说什么？

四位嘉宾给出了四种视角。

宋开发的建议是：**先把场景吃透，再考虑壁垒。**

AI声音的市场非常大，从俄罗斯这样基础翻译工具都不完善的地区，到短剧、电影、教育，各处都是空白。

但如果你只是做一个大家都能做的通用模型，迟早陷入同质化竞争。

他们选择的是千人千面的智能体路线：

给某个年龄层、某种口音、某种性格的人配音时，可以做到高精度匹配。

你对某个场景理解得越深，用户就越难离开你。

程昭瑜的建议是：**走一条无法复制的路。**

不要和大厂比制作水准，那里永远有更专业的团队。

你要比的，是源源不断地呈现出你自己的内核。

他举了一个有趣的例子：

B站上有个UP主，被称为二创抖音雨姐，本质上就是把东北日常生活碎片配上魔性旋律。

专业吗？从学院派视角看未必，但那种夹杂一点不专业的生活质感，是别人模仿不来的。

个人创业者，应该是在视频、文本、音乐之间来回穿梭，搭出自己独有的表达风格，

而不是幻想靠一首AI神曲一夜爆红。

郭瑞的建议，是**把自己放在工具方的位置上**：创作者真正想要的是被世界看见，

那你就去找出他们每一步遇到的阻碍，一点点帮他们拆掉。

而杨樾则给了两类人截然不同的建议：

对准备使用AI的音乐人来说，他建议学会放下自己那点既有旋律。

别纠结让AI把你哼的那一小段修到完美，不如试着放弃控制，把生成权交给AI，

你可能会看到比你脑子里那点东西更广阔的世界。

对坚决拒绝AI的传统音乐人，他反而说：那就请你坚持到底。

未来充满人机共创，纯碳基人类写出的音乐，将变成极度稀缺的奢侈品。

如果你能证明一张专辑完全没有AI参与，反而可以卖得更贵。

拥抱AI的人，有机会；

拒绝AI但坚持极致的人，也有机会。

真正危险的，是既不拥抱，也不坚持，只是被动观望的人。

**尾声：人类的不完美，可能是最后的版权**

那天对谈的最后，范志辉说了一句很像总结，又像提醒的话：

这个时代并不要求所有人都拥抱AI。

它真正要求的，是：无论你选哪条路，都要把那条路走得足够极致。

AI音乐和音频技术，会继续推进：声音会越来越真，情感会越来越细腻，生成速度会越来越快，价格会越来越低。

但有些东西，它大概永远也替代不了。

一段不完美的嗓音里混杂的呼吸，

一个创作者写歌时因为犹豫而多按的一次删除键，

一场演出里因为紧张而跑掉的几个音。

人类的创作，可能会从主角变成和AI共同演出的一半；

但正是这种不完美、不稳定、不可预测，

构成了我们最后的稀缺性。

AI帮我们把声音送得更远，把音乐做得更多；

而我们要做的，是想清楚：在这个被无限复制的时代，我们真正想留给世界的，到底是哪一种声音。

* * *

  

**更多对话细节**

**开场介绍**

**范志辉：**大家好，很荣幸能够在这里跟几位行业的创业者、专家一起聊这个话题。我是带着非常多的好奇和疑问来的。首先请各位嘉宾依次介绍一下自己。

**宋开发：**好的，感谢非凡大赏的邀请。我们是一家做出海的公司，主要做AI配音，现在全球有一百多万用户。像印度制片公司、国外的很多电影公司和电视台都在用我们的AI工具做配音和还原，为了让声音更具人味儿。所以今天我就围绕AI配音在全球的一些工作给大家做分享。我是宋开发，谢谢大家。

**程昭瑜：**大家好，我是程昭瑜。我们是MiniMax，一家大模型公司，涵盖视频、文本、语音和音乐。今天我主要来讲述我们音乐这部分的内容。

**郭瑞：**大家好，我是郭瑞，来自Mureka。我们有音乐模型、音乐应用，也有音乐API服务。很高兴今天见到大家。

**杨樾：**非凡的朋友们大家好，我是杨樾。43AI科技集团是一个集AI研发、落地应用、培训及投资为一体的综合性集团。我在集团主要负责音乐板块的生成和产品落地。我们现在已经有3款AI应用在全应用市场上市了，今天很开心跟大家聊聊AI音乐。

**第一轮：技术门槛与产品差异化**

**范志辉：**那我先从宋总这边提问。我做功课时看到报道提到，您认为AI配音没有80分，只有99.9分。从技术实践角度，AI配音的最大技术门槛是什么？既然速度科技已经做到99.9分了，您觉得如何避免被其他公司赶超？

**宋开发 (VMEG)：**谢谢主持人。其实配音方面我们正在朝99.9分努力。我们在全世界收到用户的反馈，出现频率最高的两个词就是 **"Natural"（自然）** 和 **"Real"（真实）**。

我们做AI是为了让声音具有人格。现在很多国内大厂或国外公司，给出的AI配音多是播音腔，且大多是成年男性或女性的声音。但在全球范围内，小孩、老人、甚至像藏族老人家这种特定的声音是非常稀缺的。我们在全球针对170多种语言进行各种音色的匹配，当用户需要某种特定声音时，我们能很好地满足。

关于壁垒，为了避免同质化竞争，我们一直在 **音色** 和 **情感** 这两个层面深耕。检验一个公司的配音好不好，用20到40分钟去测就知道了。很多配音公司在长时长下会出现音色不一致的问题，而我们的大客户通常是拿2个小时的电影来制片的。

比如印度电影，分北印度语、南印度语，他们会用我们的工具翻译配音。印度电影喜欢穿插唱歌，我们可以自动处理翻唱或保留原声。我们在声音底层做得很多，同时也深入到电影、影视、动漫、广告纪录片的工作流中，帮用户提高ROI（投资回报率）。

**范志辉：**谢谢宋总。接下来问一下MiniMax的程总。MiniMax是典型的多模态公司，相比纯粹垂直的AI音乐公司，在多模态公司做AI音乐有哪些优势？会不会遇到内部资源抢夺的问题？ 

**程昭瑜：**多模态肯定需要各个模型都占用一定的训练资源。像我们公司内部配合还是比较好的。优势确实存在，比如文本、视频和音乐之间，很多训练框架、知识跟经验是可以共用的。

尤其现在很多模型在迭代过程中，边界在慢慢变弱。虽然我们怎么处理数据、怎么定义评测标准会有区别，但整体来说，虽然我们什么都做，感觉就像是在做一个大的模型。

至于评测，这个角色其实比较微妙，因为音乐很主观。之前谈到预制菜的问题，音乐理论上没有预制一说，你写的一句新旋律只要没出现过就算原创。但为什么大家觉得很多歌听起来一样？是因为缺乏核心的、打动人的表达。

我们的评测解决两个问题：

**通用美学：** 这是一个看起来复杂但最好被定义的标准。

**独创性：** 让创作者感觉作品是独一无二的，不是预制菜的拼接，而是灵感的迸发。

**范志辉：**AI音乐模型的一个很大作用，就是让非专业人士也能捕捉灵感变成完整作品。

想问一下Mureka的郭总，听说下周要发布全新的大模型了，核心升级点有哪些？方便剧透吗？

**郭瑞：**很高兴透露一下。我们的O系列和V系列都会有更新。

用感性的话说，新模型 **更细腻** 了。我们在更细的颗粒度上表达对事物的理解。比如我们加强了语义理解，不仅听得懂风格，还能听得懂情绪，比如慵懒的下午。音质处理和编曲风格也会更丰富。

V系列是服务开发者（B端）的，商业诉求上会性能更高、更稳定、更快。还有一个大变化是**降价40%**，给商业用户留出更多利润空间。

**范志辉：**降价40%是基于什么考虑？

**郭瑞：**我们发现技术迭代跨越到了一个点。现在泛音乐领域的B端用户变多了，比如做AI视频、传统视频、游戏的公司。他们的诉求和纯粹的创作者不一样，他们需要稳定、高性能，以及能促进生态发展的利润空间。我们希望能让生态更繁荣。

**第二轮：AI音乐的本质与商业模式变革**

**范志辉：**请问43Music的杨樾老师，您既懂技术又懂音乐产业。您如何看待AI创作的本质？AI对音乐产业的创作、版权、管理、发行会带来哪些颠覆？

**杨樾：**这是两个问题。

第一，**AI音乐创作的本质。** 这一年半大家对它的理解在变化。一开始认为是高效工具，后来是专业助手。但今天，领先的模型已经能超越99%的职业音乐人。我说还有1%没超越，是留个念想，希望保留人类之光。

AI不会停下来，它不应该只是复制人类过去的音乐遗产。我非常认同一句话：**人类应该听到的99%的音乐，根本还没被做出来。** AI应该去突破人原有的创作机制和风格，做这个世界上原本不存在的音乐。这才是AI最牛的地方。

第二，**关于版权和发行。** 这是一个颠覆性的影响。传统音乐价值来自于 **稀缺性**（时间成本、机会成本、智力成本）。AI把这三件事彻底击碎了。

当AI能海量、高速生产高质量音乐时，**稀缺性被碾碎了，版权也就一文不值了。** 以前一年写十首歌，一首火了吃版权；现在一天做一百首，每一首都不值钱。

所以我们必须寻找新的价值锚点。我造了一个词叫 **MaaS (Music as a Service)**，音乐即服务。我们不卖歌，不卖版权，而是提供场景化的声音服务（如电音Party、疗愈、睡眠、学习）。我们甚至不对音乐做防盗，因为做一首歌只要15秒，偷歌还要花4分钟转录，连偷的必要都没有。

我可以确定的是，在AI海量生产的时代，传统的版权逻辑已经走不通了。

**范志辉：**如果99%的音乐人的产出没有价值了，他们的出路在哪？

**杨樾：我从来不认为AI是来取代音乐人的。** 那个说有了AI人人都能成为音乐家的说法是扯淡。音乐从来都是极少数人创造，服务于绝大多数人的。

AI对于传统音乐家是天大的利好。它会提高人类音乐的下限，淘汰垃圾音乐。原来做80分音乐的人，现在可以轻松做95分；原来做100分的人，现在能做120分。但这依然是那些具有超强学习能力的音乐家在做，而不是路人甲。

**第三轮：AI声音、配音与情感连接**

**范志辉：**刚才提到很多编曲、配音工作者可能面临困难。前几天《疯狂动物城2》的配音争议，明星抢了专业配音的活儿。宋总，您的工具对配音工作者有什么影响？

**宋开发：**AI在听觉上的讨论比视觉少，但人耳对AI是很敏感的，很容易听出是不是人味儿。

我们在海外遇到很多诉求：

**跨语言演唱：** 音乐人想用自己的声音唱外语歌（比如希伯来语、立陶宛语），他们愿意为此支付高价。

**IP原声保留：** 明星或IP方希望用自己的声音讲全球语言，因为声音有记忆度。

**教育场景：** 学生希望能听到自己熟悉的老师讲英文或中文，哪怕是AI生成的，学习效果也更好。回到《疯狂动物城2》的例子，观众对经典角色的声音是有记忆的，换人（哪怕是明星）大家可能不接受。这和短剧出海一样，西班牙语国家对AI配音容忍度高，但北美观众一听是AI就弃剧。所以我们在攻克技术难点，比如**AI哭腔**、**异口同声**（多人重叠说话要有立体感）。未来在同传领域，领导在台上讲话，台下听众能听到**领导本人的声音**讲着各国语言，这也是一个巨大的场景。

**第四轮：工作流融合与增长策略**

**范志辉：**问一下MiniMax程总，作为创作者和产品负责人，您怎么看AI工具融合进工作流？如何平衡效率和个性化？

**程昭瑜：**我们的产品目前是一键式的，只要你有灵感，我就给你一首歌。对于流行音乐，普通听众已经很难区分是AI还是人做的。

AI作为辅助工具一直存在（如Logic、Ableton），把物理声音转化为节奏。现在的AI不同之处在于，它是全新的创作思路。不仅仅是降本增效，更是让个人成为超级个体。随着音乐人与技术的连接更深，效率和丰富性都会提高。

**范志辉：**Mureka的郭总，在全球市场中，你们如何制定增长策略？C端和B端哪个变现效率高？

**郭瑞：**做增长不能只看增长黑客那一套数据，**核心还是要回到人，回到客户需求。**

**音乐人/创作者：** 他们的需求是表达。我们需要提供更便捷的方式帮助他们完成对世界的表达。

**B端/开发者：** 需求是控制和稳定。这一点上，**Domain Expertise（领域专业知识）** 非常重要。AI不可能取代人类，只有真的懂音乐、懂用户场景，才能做好增长。

**范志辉：**杨樾老师，43Music做不同场景切口的逻辑是什么？

**杨樾：**从去年10月到现在，我们经历了模型的迭代和对边界的探索。

第一，探索AI生成音乐的边界。

第二，研究垂直门类。我们花了三分之一的时间在做调研，研究**心理学**和**脑科学**。比如做瑜伽音乐，我们找了很多瑜伽老师，发现他们以前也是被动选择音乐。现在我们可以主动创造适合该场景的音乐。

做运动健身音乐时，我们建立了智能体去测算身体数据、运动成绩与音乐的关系。

这是一场反过来的市场变革：以前是有什么听什么，现在是需要什么创造什么。

至于为什么不做单曲打榜？因为现在是音乐最糟糕的时代，**流量被平台劫持，推广成本极高**。用零成本生产的AI音乐，去走巨高成本、巨高风险的传统宣发老路，商业上是不划算的。所以我们被逼着走向了场景服务（MaaS）。

**第五轮：给创业者的建议**

**范志辉：**最后给想进入AI音频赛道的创业者一个建议。

**宋开发：**AI声音领域非常广，比如俄罗斯市场连基础的翻译工具都很缺，机会很多。

建议大家**建立壁垒**。我们现在的壁垒是千人千面的翻译配音智能体。比如导演要求给特定年龄段的人看、带有特定口音，我们能精准匹配。你对场景了解越深，用户壁垒就越高。

**程昭瑜：**我建议大家走无法复制**的路线。不要去跟网易云、抖音上的神曲比专业度。你要比的是**源源不断地还原你内核的特点。

举个例子，B站有个二创抖音雨姐，用东北日常生活配上洗脑旋律，大家听她是因为在专业中混杂了一点不专业，那种生活美学是独有的。个人创业者应该结合视频、文本、音乐多种工具，创造出独有的价值，而不是去追求昙花一现的神曲。

**郭瑞：**我们不仅看技术，更看**艺术和技术的结合点**。创作者最终的诉求是被世界看到。我们作为工具方，就是看创作者遇到什么阻碍，提供解决方案，帮助他们表达。

**杨樾：**我有两个建议：

**给准备用AI的音乐人：学会放下。** 放下你脑子里那点既有的旋律。不要试图让AI帮你完善你哼的那一段，AI生成的灵感远比你那点东西美好得多。把自我搁在一边，彻底让AI去创造。

**给拒绝AI的传统音乐人：坚持到底。** 如果你讨厌AI，千万别用。未来全是人机共创，**纯碳基人类创作的音乐**将成为极度的稀缺品。如果你能证明你的音乐是纯人做的，那应该卖得最贵。拥抱的和拒绝的人，都有机会。

**范志辉：**有一种醍醐灌顶的感觉。这个时代不需要所有人必须拥抱AI，但只要有足够的独创性和稀缺性，都能找到位置。人类的不完美或许就是最后的稀缺性。谢谢四位嘉宾的精彩分享！

---

原始发布版本：https://view.inews.qq.com/a/20251128A04W3J00

本站阅读页：https://ffcap.cn/research/20251128a04w3j00
