跳到正文
非凡资本

访谈与对话 / UNIQUERESEARCH

资深从业者暴论:AI时代“偷”歌的成本比做歌还高

如果有一天,世界上 99% 的音乐都不是人写的,你还会为一首歌单曲循环吗?

当短剧用上 AI 配乐、电影用上 AI 配音、健身房、瑜伽馆、直播间背后的所有 BGM 都由算法实时生成,音乐这门最感性的生意,会被改造成什么样子?

在2025北京非凡大赏的一场圆桌会议上,我们把这样的问题抛给了四位站在一线的人:

主持人是做了多年行业深度观察的 范志辉(音乐先声 & 文娱先声 创始人);

做全球 AI 配音业务的 宋开发(VMEG 联合创始人 & COO),每天在跟印度制片公司、海外电视台一起打磨有人格的声音;

来自多模态大模型公司的 程昭瑜(MiniMax 音乐总监),在思考一件事:当文本、视频、语音和音乐都交给同一个模型,会催生出怎样全新的创作方式;

为音乐人和开发者提供音乐模型与 API 的 郭瑞(Mureka 增长营销负责人),在第一线感受到商业化和成本曲线的真实压力;

以及同时身兼音乐人和 AI 创业者的 杨樾(43AI 科技集团联合创始人 & 43Music CEO),提出了那个颇具争议的判断:人类应该听到的 99% 的音乐,其实还没被做出来。

这篇文章不是简单的逐字整理,而是把那一时刻的观点、分歧和顿悟重新串起来,当 AI 开始写歌,音乐产业的游戏规则还有多少是原来的样子?

资深从业者暴论:AI时代“偷”歌的成本比做歌还高 · 原文图片 1

一. 从播音腔到人味儿:配音行业正在被重写

先上来的是最落地的业务,AI配音。

宋开发说,他们做VMEG这家公司,专门给全世界的内容配音:短剧、电影、动漫、广告、纪录片。目前已经有一百多万用户,遍布印度制片公司、海外电视台、电影公司。

在全球用户的反馈里,出现频率最高的两个词是:

Natural(自然) 和 Real(真实)。

传统的AI配音,尤其是很多大厂出的模型,声音普遍像播音主持:标准、清晰、无瑕疵,也无惊喜。大多都只是成年男女嗓音,情绪平铺直叙。

而真实世界需要的声音远比这个复杂得多。孩子、老人、方言、口音,甚至藏族老奶奶这种特别窄的音色,都是稀缺资源。

VMEG在做的事情,用一句话概括是:在170多种语言上,把声音的长尾补齐。

不只是能说,还要能说长。

很多AI配音产品,读个几十秒广告没问题,一到长视频就暴露:声音前后音色不一致、情绪突然变调、人物人格崩坏。

而宋开发的客户,大多是拿着两小时电影来测试的。电影里还有歌曲、情绪爆点和大量对话,稍不注意就穿帮。

所以他们把壁垒压在两个字上:音色 和 情感。

当你能让一个虚拟的声音,连续几小时维持稳定的人格,还能在哭、笑、愤怒、沉默里自然过渡时,配音不再只是听得懂,而是听得进去。

如果你想象一下未来:一部印度电影,可以用北印度语、南印度语、多国语言自动配音;

歌曲部分可以选择翻唱还是保留原声;

所有这些都嵌在制片工作流里,导演只管看结果。

你就会理解,为什么宋开发强调,真正的壁垒,不在会说话,而在懂电影。

资深从业者暴论:AI时代“偷”歌的成本比做歌还高 · 原文图片 2

二. 当音乐失去稀缺性,版权逻辑会崩盘吗?

如果说配音是在修补原有产业链上的效率洞,那43Music干的事情,更接近于重做一套逻辑。

杨樾的观点很直接:

过去这一年半,大家对AI音乐的看法从高效工具,变成专业助手,再到今天——领先模型已经可以超过绝大多数职业音乐人。

他留了个余地,说还有1%没被超过,是给人类留点尊严,但话里的意思不难听懂:

AI在创作层面,不再是玩具,而是真正的生产力。

问题来了:传统音乐产业的价值基础是什么?

很简单:稀缺性。

写歌要时间,要经验,要灵感,还要机会成本。

所以一首爆款单曲的版权,能源源不断给创作者带来收益。

但AI让这一切碎掉了。

当模型可以在短时间内大量产出高质量音乐,写一首歌这件事不再稀缺,版权自然也抬不起价格。

你一年写十首歌,其中一首火了,版权养你十年;

AI一天帮你生成一百首歌,每首都还不错,但都没有非它不可的理由。

于是,杨樾提出了一个新概念:MaaS——Music as a Service,音乐即服务。

在这套逻辑里,音乐不再被当成一首首作品出售,而是变成与场景绑定的服务能力:

给瑜伽馆的是一整套符合呼吸节奏和肌肉放松节奏的音乐;

给运动场景的是根据心率和成绩反馈动态调节节奏的音乐;

给睡眠和冥想的是能降低紧张感、帮助入睡的声音处方;

给学习和专注的是维持节奏但不过度抢注意力的背景声。

音乐不再是听什么就算什么,而是你需要什么,我就生成什么。

更有意思的是,他们甚至不做严厉的防盗策略。

原因很现实:

做一首歌只要十五秒,

偷一首歌还得花四分钟去转录、导入、清洗。

在一个生产成本接近于零的时代,防盗本身变得不经济。

真正值钱的,不再是那一首歌,而是你能否持续为某个场景,提供真正有用的声音解决方案。

资深从业者暴论:AI时代“偷”歌的成本比做歌还高 · 原文图片 3

三. 多模态厂牌:为什么还要费力去做音乐?

如果你是一个大模型公司,已经在文本、图像、视频上厮杀,为什么还要上音乐这个看上去小众又难评估的方向?

MiniMax给出的答案,是多模态之间的共振。

程昭瑜提到:在一个多模态的架构里,文本、语音、视频、音乐,并不是四条平行线,而是很多地方可以共用底层经验和训练框架的。

更重要的是,当模型能力越来越强,边界正在变模糊。

你很难再把这是专门做音乐的模型和这是做视频的模型完全分开,因为一段影视内容,本身就同时包含画面、对白、音效、配乐。

从产品层面来看,他们现在在做一键式创作:

你有一个灵感,一段文字或者一个简单的提示,就能生成一首完整的歌。

对于大部分听众来说,一首AI生成的流行歌和人类制作的,已经很难靠耳朵区分。

真正难的,不是音色像不像,而是两个词:美感 和 独创性。

美感可以通过大量数据学习,粗暴地说就是:别太难听、别太突兀、别脱离基本的音乐审美。

但独创性就麻烦了。

在理论上,只要你写出的旋律没有在世界上出现过,那就是原创。

然而现实世界里,我们都知道:为什么那么多歌听起来差不多?

因为它们只是在配方上换了几味香料,本质还是预制菜。

MiniMax在做的,是用评测体系去回答两个问题:

一首歌是否符合通用美学,至少不要让人听着难受;

同时是否又能给创作者一种这东西就是我的感觉,而不是一堆套路拼出来的声音模板。

当多模态的能力叠加起来,音乐就不再只是配上去的BGM。

它可以和画面、文本一起被设计,成为整个内容体验的一部分。

资深从业者暴论:AI时代“偷”歌的成本比做歌还高 · 原文图片 4

四. 从模型迭代到降价 40%:B 端生意的现实拐点

聊技术容易兴奋,但所有兴奋,最后都要落回一句话:赚钱难不难?

Mureka的回答非常务实。他们一边在做面向创作者的音乐产品,一边在为开发者提供API和模型服务。

郭瑞透露,他们即将更新的 O 系列和 V 系列模型,整体会变得更细腻:

不仅能听懂爵士风摇滚风这种粗粒度风格,还能捕捉慵懒的下午微微心碎但不崩溃这类细腻情绪。

在B端,模型会更稳定、更高速、更易控制。然后是一句非常关键的话:新一代模型,将整体降价40%。

为什么?

因为他们发现,接入音乐模型的B端公司越来越多:

做AI视频的,做传统视频广告的,做游戏的,做虚拟偶像的……

这些客户的诉求和独立音乐人完全不同,他们更看重:

能不能稳定输出?

延迟够不够低?

价格结构能不能支撑整个生态赚钱?

如果模型厂商把自己定在生态链的最上游,却把价格卡得很死,下面一圈做应用的人没钱赚,这个生态很快就会枯萎。

所以降价不是做慈善,而是一个冷静的判断:

当技术跨过某个门槛,合理让利,反而会放大整个市场。

资深从业者暴论:AI时代“偷”歌的成本比做歌还高 · 原文图片 5

五. 声音的记忆:配音不是替代,而是放大情感

回到声音本身,它不只是信息载体,更是情感记忆。

最近《疯狂动物城2》在国内因为配音问题讨论很热:观众不是不爱明星,而是不愿意放弃自己对经典角色声音的记忆。

宋开发在海外做配音时,看到了更细致的需求:有音乐人希望用自己的声音唱完全不会的语言,比如希伯来语、立陶宛语;有明星和IP方希望用自己的原声人格,说遍全世界的语言;有学生希望听到熟悉的老师讲各国语言课程,哪怕这些音频是AI生成的,学习体验会更亲切。

这些需求都指向一个事实:声音是记忆的索引。

当你听到一个熟悉的声线,大脑会自动唤起和它绑定的情绪。

这也是为什么,不同地区对AI配音的容忍度差异巨大。

在一些拉美国家,观众对AI配音版本的短剧接受度很高;但在北美,很多用户一听出来这好像不是人,就立刻弃剧。

为了让AI声音不穿帮,VMEG在攻克一些看上去很细节,但对体验极其重要的能力:比如AI哭腔,让声音在哭的时候真的有颤抖与破音;比如异口同声,多人同时说话的立体感和空间感;比如未来的会议同传,台上领导讲中文,台下每个人都能听到领导本人的声音讲英文、日文、西班牙语。

这里面有技术挑战,但本质仍然是那句话:AI不是来消灭人的,而是把人的情感放大到更大的世界。

六. 创作工具变了,但音乐家这件事没变

那普通的音乐从业者应该焦虑吗?

杨樾给了一个很不鸡汤的回答:有了AI人人都能成为音乐家这句话,是扯的。

音乐从来都是极少数人的事业。

只是过去的门槛在于技巧、乐理、器乐和制作能力,如今门槛在于另一件事。

你是不是一个愿意持续学习、不断升级玩法的人。

AI的出现,只是在拉高整个行业的平均分:

原来只能做80分作品的人,现在有机会借助工具做出95分;

原来能做到100分的人,有机会做到120分。

这个过程带来的一个结果是:垃圾音乐会被大量淘汰。

但这并不意味着所有人都没机会了。

相反,它让真正有表达欲、有独特视角的人,更有机会突破。

程昭瑜说,未来的个人创作者,很可能都是超级个体:一人既是文案、导演,又是配乐师和制片人。

AI不是在替你写歌,而是在帮你把脑子里的那一闪,以最低摩擦变成完整作品。

只要你有东西可说,有情绪可分享,就永远有机会。

七. 增长的底层逻辑:先回到人,再谈增长黑客

聊到商业化,话题自然绕不开增长。

但Mureka的观点是:如果增长只盯着数据和黑客技巧,而脱离了创作者和用户本身,最后一定会走偏。

在他们的视角里,有两群主要用户:一群是创作者和音乐人,他们真正的需求叫表达。

他们不一定在乎这首歌能不能上榜,更关心的是:有没有一个足够顺手的工具,帮他们把脑子里的画面变成可以被听到的东西。

另一群是B端客户和开发者,他们的需求不是浪漫,而是可控和稳定。

能不能通过API稳定调用?

能不能保证每次输出质量稳定?

能不能根据业务场景做细致调参?

这里有一个被反复提到的关键词:Domain Expertise,领域专业性。

AI不会自动理解一个瑜伽老师、一个健身教练、一家广告公司真正需要的是什么。

必须有一批同时懂音乐、懂产品、懂行业场景的人,把技术翻译成业务语言。

增长不是拉新+转化+留存几个公式,而是你能不能持续地帮这一群人解决实际问题。

八. 给想做AI音频的创业者:壁垒、不复制和放下自己

聊到最后,范志辉问了一个所有人都在想的问题:如果现在要进入AI音频赛道,你们各自给一句建议,会说什么?

四位嘉宾给出了四种视角。

宋开发的建议是:先把场景吃透,再考虑壁垒。

AI声音的市场非常大,从俄罗斯这样基础翻译工具都不完善的地区,到短剧、电影、教育,各处都是空白。

但如果你只是做一个大家都能做的通用模型,迟早陷入同质化竞争。

他们选择的是千人千面的智能体路线:

给某个年龄层、某种口音、某种性格的人配音时,可以做到高精度匹配。

你对某个场景理解得越深,用户就越难离开你。

程昭瑜的建议是:走一条无法复制的路。

不要和大厂比制作水准,那里永远有更专业的团队。

你要比的,是源源不断地呈现出你自己的内核。

他举了一个有趣的例子:

B站上有个UP主,被称为二创抖音雨姐,本质上就是把东北日常生活碎片配上魔性旋律。

专业吗?从学院派视角看未必,但那种夹杂一点不专业的生活质感,是别人模仿不来的。

个人创业者,应该是在视频、文本、音乐之间来回穿梭,搭出自己独有的表达风格,

而不是幻想靠一首AI神曲一夜爆红。

郭瑞的建议,是把自己放在工具方的位置上:创作者真正想要的是被世界看见,

那你就去找出他们每一步遇到的阻碍,一点点帮他们拆掉。

而杨樾则给了两类人截然不同的建议:

对准备使用AI的音乐人来说,他建议学会放下自己那点既有旋律。

别纠结让AI把你哼的那一小段修到完美,不如试着放弃控制,把生成权交给AI,

你可能会看到比你脑子里那点东西更广阔的世界。

对坚决拒绝AI的传统音乐人,他反而说:那就请你坚持到底。

未来充满人机共创,纯碳基人类写出的音乐,将变成极度稀缺的奢侈品。

如果你能证明一张专辑完全没有AI参与,反而可以卖得更贵。

拥抱AI的人,有机会;

拒绝AI但坚持极致的人,也有机会。

真正危险的,是既不拥抱,也不坚持,只是被动观望的人。

尾声:人类的不完美,可能是最后的版权

那天对谈的最后,范志辉说了一句很像总结,又像提醒的话:

这个时代并不要求所有人都拥抱AI。

它真正要求的,是:无论你选哪条路,都要把那条路走得足够极致。

AI音乐和音频技术,会继续推进:声音会越来越真,情感会越来越细腻,生成速度会越来越快,价格会越来越低。

但有些东西,它大概永远也替代不了。

一段不完美的嗓音里混杂的呼吸,

一个创作者写歌时因为犹豫而多按的一次删除键,

一场演出里因为紧张而跑掉的几个音。

人类的创作,可能会从主角变成和AI共同演出的一半;

但正是这种不完美、不稳定、不可预测,

构成了我们最后的稀缺性。

AI帮我们把声音送得更远,把音乐做得更多;

而我们要做的,是想清楚:在这个被无限复制的时代,我们真正想留给世界的,到底是哪一种声音。



更多对话细节

开场介绍

范志辉:大家好,很荣幸能够在这里跟几位行业的创业者、专家一起聊这个话题。我是带着非常多的好奇和疑问来的。首先请各位嘉宾依次介绍一下自己。

宋开发:好的,感谢非凡大赏的邀请。我们是一家做出海的公司,主要做AI配音,现在全球有一百多万用户。像印度制片公司、国外的很多电影公司和电视台都在用我们的AI工具做配音和还原,为了让声音更具人味儿。所以今天我就围绕AI配音在全球的一些工作给大家做分享。我是宋开发,谢谢大家。

程昭瑜:大家好,我是程昭瑜。我们是MiniMax,一家大模型公司,涵盖视频、文本、语音和音乐。今天我主要来讲述我们音乐这部分的内容。

郭瑞:大家好,我是郭瑞,来自Mureka。我们有音乐模型、音乐应用,也有音乐API服务。很高兴今天见到大家。

杨樾:非凡的朋友们大家好,我是杨樾。43AI科技集团是一个集AI研发、落地应用、培训及投资为一体的综合性集团。我在集团主要负责音乐板块的生成和产品落地。我们现在已经有3款AI应用在全应用市场上市了,今天很开心跟大家聊聊AI音乐。

 

第一轮:技术门槛与产品差异化

范志辉:那我先从宋总这边提问。我做功课时看到报道提到,您认为AI配音没有80分,只有99.9分。从技术实践角度,AI配音的最大技术门槛是什么?既然速度科技已经做到99.9分了,您觉得如何避免被其他公司赶超?

宋开发 (VMEG):谢谢主持人。其实配音方面我们正在朝99.9分努力。我们在全世界收到用户的反馈,出现频率最高的两个词就是 "Natural"(自然) 和 "Real"(真实)。

我们做AI是为了让声音具有人格。现在很多国内大厂或国外公司,给出的AI配音多是播音腔,且大多是成年男性或女性的声音。但在全球范围内,小孩、老人、甚至像藏族老人家这种特定的声音是非常稀缺的。我们在全球针对170多种语言进行各种音色的匹配,当用户需要某种特定声音时,我们能很好地满足。

关于壁垒,为了避免同质化竞争,我们一直在 音色 和 情感 这两个层面深耕。检验一个公司的配音好不好,用20到40分钟去测就知道了。很多配音公司在长时长下会出现音色不一致的问题,而我们的大客户通常是拿2个小时的电影来制片的。

比如印度电影,分北印度语、南印度语,他们会用我们的工具翻译配音。印度电影喜欢穿插唱歌,我们可以自动处理翻唱或保留原声。我们在声音底层做得很多,同时也深入到电影、影视、动漫、广告纪录片的工作流中,帮用户提高ROI(投资回报率)。

范志辉:谢谢宋总。接下来问一下MiniMax的程总。MiniMax是典型的多模态公司,相比纯粹垂直的AI音乐公司,在多模态公司做AI音乐有哪些优势?会不会遇到内部资源抢夺的问题? 

程昭瑜:多模态肯定需要各个模型都占用一定的训练资源。像我们公司内部配合还是比较好的。优势确实存在,比如文本、视频和音乐之间,很多训练框架、知识跟经验是可以共用的。

尤其现在很多模型在迭代过程中,边界在慢慢变弱。虽然我们怎么处理数据、怎么定义评测标准会有区别,但整体来说,虽然我们什么都做,感觉就像是在做一个大的模型。

至于评测,这个角色其实比较微妙,因为音乐很主观。之前谈到预制菜的问题,音乐理论上没有预制一说,你写的一句新旋律只要没出现过就算原创。但为什么大家觉得很多歌听起来一样?是因为缺乏核心的、打动人的表达。

我们的评测解决两个问题:

通用美学: 这是一个看起来复杂但最好被定义的标准。

独创性: 让创作者感觉作品是独一无二的,不是预制菜的拼接,而是灵感的迸发。

范志辉:AI音乐模型的一个很大作用,就是让非专业人士也能捕捉灵感变成完整作品。

想问一下Mureka的郭总,听说下周要发布全新的大模型了,核心升级点有哪些?方便剧透吗?

郭瑞:很高兴透露一下。我们的O系列和V系列都会有更新。

用感性的话说,新模型 更细腻 了。我们在更细的颗粒度上表达对事物的理解。比如我们加强了语义理解,不仅听得懂风格,还能听得懂情绪,比如慵懒的下午。音质处理和编曲风格也会更丰富。

V系列是服务开发者(B端)的,商业诉求上会性能更高、更稳定、更快。还有一个大变化是降价40%,给商业用户留出更多利润空间。

范志辉:降价40%是基于什么考虑?

郭瑞:我们发现技术迭代跨越到了一个点。现在泛音乐领域的B端用户变多了,比如做AI视频、传统视频、游戏的公司。他们的诉求和纯粹的创作者不一样,他们需要稳定、高性能,以及能促进生态发展的利润空间。我们希望能让生态更繁荣。

 

第二轮:AI音乐的本质与商业模式变革

范志辉:请问43Music的杨樾老师,您既懂技术又懂音乐产业。您如何看待AI创作的本质?AI对音乐产业的创作、版权、管理、发行会带来哪些颠覆?

杨樾:这是两个问题。

第一,AI音乐创作的本质。 这一年半大家对它的理解在变化。一开始认为是高效工具,后来是专业助手。但今天,领先的模型已经能超越99%的职业音乐人。我说还有1%没超越,是留个念想,希望保留人类之光。

AI不会停下来,它不应该只是复制人类过去的音乐遗产。我非常认同一句话:人类应该听到的99%的音乐,根本还没被做出来。 AI应该去突破人原有的创作机制和风格,做这个世界上原本不存在的音乐。这才是AI最牛的地方。

第二,关于版权和发行。 这是一个颠覆性的影响。传统音乐价值来自于 稀缺性(时间成本、机会成本、智力成本)。AI把这三件事彻底击碎了。

当AI能海量、高速生产高质量音乐时,稀缺性被碾碎了,版权也就一文不值了。 以前一年写十首歌,一首火了吃版权;现在一天做一百首,每一首都不值钱。

所以我们必须寻找新的价值锚点。我造了一个词叫 MaaS (Music as a Service),音乐即服务。我们不卖歌,不卖版权,而是提供场景化的声音服务(如电音Party、疗愈、睡眠、学习)。我们甚至不对音乐做防盗,因为做一首歌只要15秒,偷歌还要花4分钟转录,连偷的必要都没有。

我可以确定的是,在AI海量生产的时代,传统的版权逻辑已经走不通了。

范志辉:如果99%的音乐人的产出没有价值了,他们的出路在哪?

杨樾:我从来不认为AI是来取代音乐人的。 那个说有了AI人人都能成为音乐家的说法是扯淡。音乐从来都是极少数人创造,服务于绝大多数人的。

AI对于传统音乐家是天大的利好。它会提高人类音乐的下限,淘汰垃圾音乐。原来做80分音乐的人,现在可以轻松做95分;原来做100分的人,现在能做120分。但这依然是那些具有超强学习能力的音乐家在做,而不是路人甲。

 

第三轮:AI声音、配音与情感连接

范志辉:刚才提到很多编曲、配音工作者可能面临困难。前几天《疯狂动物城2》的配音争议,明星抢了专业配音的活儿。宋总,您的工具对配音工作者有什么影响?

宋开发:AI在听觉上的讨论比视觉少,但人耳对AI是很敏感的,很容易听出是不是人味儿。

我们在海外遇到很多诉求:

跨语言演唱: 音乐人想用自己的声音唱外语歌(比如希伯来语、立陶宛语),他们愿意为此支付高价。

IP原声保留: 明星或IP方希望用自己的声音讲全球语言,因为声音有记忆度。

教育场景: 学生希望能听到自己熟悉的老师讲英文或中文,哪怕是AI生成的,学习效果也更好。回到《疯狂动物城2》的例子,观众对经典角色的声音是有记忆的,换人(哪怕是明星)大家可能不接受。这和短剧出海一样,西班牙语国家对AI配音容忍度高,但北美观众一听是AI就弃剧。所以我们在攻克技术难点,比如AI哭腔、异口同声(多人重叠说话要有立体感)。未来在同传领域,领导在台上讲话,台下听众能听到领导本人的声音讲着各国语言,这也是一个巨大的场景。

 

第四轮:工作流融合与增长策略

范志辉:问一下MiniMax程总,作为创作者和产品负责人,您怎么看AI工具融合进工作流?如何平衡效率和个性化?

程昭瑜:我们的产品目前是一键式的,只要你有灵感,我就给你一首歌。对于流行音乐,普通听众已经很难区分是AI还是人做的。

AI作为辅助工具一直存在(如Logic、Ableton),把物理声音转化为节奏。现在的AI不同之处在于,它是全新的创作思路。不仅仅是降本增效,更是让个人成为超级个体。随着音乐人与技术的连接更深,效率和丰富性都会提高。

范志辉:Mureka的郭总,在全球市场中,你们如何制定增长策略?C端和B端哪个变现效率高?

郭瑞:做增长不能只看增长黑客那一套数据,核心还是要回到人,回到客户需求。

音乐人/创作者: 他们的需求是表达。我们需要提供更便捷的方式帮助他们完成对世界的表达。

B端/开发者: 需求是控制和稳定。这一点上,Domain Expertise(领域专业知识) 非常重要。AI不可能取代人类,只有真的懂音乐、懂用户场景,才能做好增长。

范志辉:杨樾老师,43Music做不同场景切口的逻辑是什么?

杨樾:从去年10月到现在,我们经历了模型的迭代和对边界的探索。

第一,探索AI生成音乐的边界。

第二,研究垂直门类。我们花了三分之一的时间在做调研,研究心理学和脑科学。比如做瑜伽音乐,我们找了很多瑜伽老师,发现他们以前也是被动选择音乐。现在我们可以主动创造适合该场景的音乐。

做运动健身音乐时,我们建立了智能体去测算身体数据、运动成绩与音乐的关系。

这是一场反过来的市场变革:以前是有什么听什么,现在是需要什么创造什么。

至于为什么不做单曲打榜?因为现在是音乐最糟糕的时代,流量被平台劫持,推广成本极高。用零成本生产的AI音乐,去走巨高成本、巨高风险的传统宣发老路,商业上是不划算的。所以我们被逼着走向了场景服务(MaaS)。

 

第五轮:给创业者的建议

范志辉:最后给想进入AI音频赛道的创业者一个建议。

宋开发:AI声音领域非常广,比如俄罗斯市场连基础的翻译工具都很缺,机会很多。

建议大家建立壁垒。我们现在的壁垒是千人千面的翻译配音智能体。比如导演要求给特定年龄段的人看、带有特定口音,我们能精准匹配。你对场景了解越深,用户壁垒就越高。

程昭瑜:我建议大家走无法复制的路线。不要去跟网易云、抖音上的神曲比专业度。你要比的是源源不断地还原你内核的特点。

举个例子,B站有个二创抖音雨姐,用东北日常生活配上洗脑旋律,大家听她是因为在专业中混杂了一点不专业,那种生活美学是独有的。个人创业者应该结合视频、文本、音乐多种工具,创造出独有的价值,而不是去追求昙花一现的神曲。

郭瑞:我们不仅看技术,更看艺术和技术的结合点。创作者最终的诉求是被世界看到。我们作为工具方,就是看创作者遇到什么阻碍,提供解决方案,帮助他们表达。

杨樾:我有两个建议:

给准备用AI的音乐人:学会放下。 放下你脑子里那点既有的旋律。不要试图让AI帮你完善你哼的那一段,AI生成的灵感远比你那点东西美好得多。把自我搁在一边,彻底让AI去创造。

给拒绝AI的传统音乐人:坚持到底。 如果你讨厌AI,千万别用。未来全是人机共创,纯碳基人类创作的音乐将成为极度的稀缺品。如果你能证明你的音乐是纯人做的,那应该卖得最贵。拥抱的和拒绝的人,都有机会。

范志辉:有一种醍醐灌顶的感觉。这个时代不需要所有人必须拥抱AI,但只要有足够的独创性和稀缺性,都能找到位置。人类的不完美或许就是最后的稀缺性。谢谢四位嘉宾的精彩分享!

来源:非凡产研 · 腾讯新闻。文章中的“非凡产研”是原始发布账号署名,不代表已核实个人执笔作者。引用访谈或圆桌观点时,应按正文标明具体发言人及当时身份;无法确认时不要推断。日期为原始发表日期,历史信息以发布时点为准。

阅读原始发布版本 ↗
← 返回研究文章库