一秒生成100首曲子,中国AI创业者靠什么翻过Suno这座大山?
中国玩家的“阳谋”
当AI的“生成力”严重溢出、门槛被彻底踩平日,
它反而把人类最值钱的两张底牌逼了出来:那是一双极其挑剔的耳朵,以及人类独有的、哪怕只有0.1秒的情感崩溃。
一分钟写出一首歌,甚至唱出以假乱真的人声。在Suno横空出世后,整个音乐和音频制作圈都经历了一次巨大的PTSD。
大家都在问:如果随便敲几行提示词,AI就能生成如此顶级的爆款口水歌,那些辛辛苦苦学了十年乐器、背了无数乐理的音乐人,还要指望什么吃饭?更别提最近Sora、可灵这些视觉模型,连“音画同出”的活儿都包揽了。
这听上去像是要把音频从业者赶尽杀绝的剧本。
但在非凡大赏·杭州 AI WEEK 的这场关于“AI音频”的趋势圆桌上,几位局内人讲出的真相,却跟大众的恐慌截然相反。
当AI的“生成力”严重溢出、门槛被彻底踩平日,它反而把人类最值钱的两张底牌逼了出来:那是一双极其挑剔的耳朵,以及人类独有的、哪怕只有0.1秒的情感崩溃。
不正面硬刚Suno,中国玩家的“阳谋”
聊AI音乐,Suno是一座绕不开的大山。
作为音潮(自由量级)的CTO,姜涛是被拿来对标最多次的人。但他的解法非常直接:“我们跟Suno其实并不是竞争关系。大家没必要在同一个赛道里正面硬刚。”
Suno正变得越来越像一个复杂的专业端工具,试图垄断专业音乐人的工作流。但在姜涛看来,广大的普罗大众、影视剧、短剧和游戏,这片蓝海还饿得很。在真正去跟巨头拼算力之前,姜涛觉得有一件更紧迫的事要解决——替用户争夺版权。
这也是目前创作者最窝火的地方:我在流媒体上辛辛苦苦调教大模型写出来的歌,因为平台捆绑,最后版权居然不属于我?
“在谈版权之前,首先要承认用户的‘创作权’。”姜涛的团队在产品里明确,不管你怎么生成,版权归用户,平台不抢。因为在这个时代,用户是用脚投票的。哪个平台能保护创作者的心血并让他们变现,流量就会流向哪里。
如果说姜涛选择的是“生态突围”,那么ACE Studio的联合创始人赵文骁,则玩了一手经典的“降维打击”。
对于怎么反抗闭源巨头这件事,历史早就给过答案。
“回想一下,当年Midjourney是闭源的,但Stable Diffusion一开源,整个生态就爆炸了,演化出了无数的控制插件。”赵文骁的做法如出一辙。ACE直接开源了ACE 1.5模型的所有权重,让玩家自己去炼Lora、接ComfyUI和工作流。
既然大模型固化了对音乐的理解,那就把底层的枪炮全拆散了发给大家。用开源的汪洋大海去淹没闭源的孤岛,这就是中国AI玩家在巨头阴影下打出的最漂亮的一张牌。
低端配音全靠跑量,极端情绪全靠人
除了音乐,AI语音合成(TTS)也是重灾区。很多人觉得,现在的翻译配音软件这么牛,甚至有了“音画同出”的模型,传统的配音出海公司是不是快倒闭了?
做AI配音出海的素动科技COO宋开发,戳破了这个唯技术论的幻象。
首先,大模型的“音画同出”确实很爽,但它只适用于从零生成的“增量内容”。而现在满世界等着赚钱的,是国内海量的短剧、动画和游戏在走向海外的“存量内容”。为了出海赚美金,他们要把东北口音翻译成纯正的南印度语或德语。在这块,大模型的微商式抽卡根本跑不通,还得靠专业的AI本地化去啃。
但宋开发讲了一个极其核心的现象:在这场AI海啸里,低端的配音演员确实被端掉了饭碗。可那些处于金字塔尖的高级老配音员,反而变得更抢手了。
为什么?
因为AI解决不了人类瞬间的心理失衡。
“我们在很短时间里‘我要哭、我要闹、我要吵’的这种极致情绪,AI在0.1秒、1秒以内是根本搞不定的。这种短暂的情绪大爆发,只有人类能搞定。”
基于这个逻辑,宋开发团队定下了一个极为硬核的铁律:“你没说过的话,我是不会去配的。”如果有人拿一个明星的声音来要求克隆一句他根本没说过的话,单子直接拒掉。这不仅是底线,更是在保卫那些高级别配音老师的独家权益。
机器负责廉价的铺陈,人负责昂贵的高潮。这是AI配音的真实写照。
既然都会被取代,为什么还要逼孩子练琴?
当所有的工具和商业模式都在狂奔时,压力不可避免地给到了教育端。
当一句话就能生成旋律,现在的家长还要逼着孩子去考级、去学一门甚至几门乐器吗?
这个直击灵魂的焦虑,被丢给了浙江音乐学院的段瑞雷主任。
“好的东西,永远是聪明的人花笨功夫做出来的。”段主任的回应非常笃定。
在AI时代让孩子学乐器,根本不是为了让他们像机器一样去比拼“弹得多快无错音”,那是自取其辱。真正核心的诉求,是为了建立品味和审美。
这也是全场最通透的一个诊断。如果未来AI一秒钟能给你出100首曲子,在浩如烟海的算力垃圾里,你的孩子凭什么能第一秒就挑出最好听、最有灵魂的那一首?
没有在枯燥的指法里熬过、没有在和声里纠结过的耳朵,是挑不出真正的好音乐的。这其实也是整个 AI 的悖论:只有真正懂行的人,才能用 AI 做出超越 AI 的东西。
这就好比无论网课再怎么清晰,它也替代不了一个活生生的人。
当你弹错一个音阶时,你的老师给予你的一句训斥,或者一个安抚的抚摸。“教育是一棵树去摇动另一棵树。这种具身陪伴和情感色彩,我不认为目前的AI有替代的可能性。”
所有的恐慌,其实都来源于我们把AI当成了“人”。
但这场对谈撕开了那层滤镜。AI 永远只是工具,它负责拉高所有人的底线,让五音不全的人也能体会创作的爽感。但能冲破天花板的,依然是那些用笨功夫熬出好审美,并在0.1秒内崩溃大哭的普通人。
更多对话细节
非凡大赏·杭州 AI WEEK 趋势圆桌 Panel
《音乐与音频:AI技术推动的内容生产工业化进程》
嘉宾:
自由量级 CTO-姜涛
ACE Studio 联合创始人-赵文骁
VMEG 联合创始人&COO-宋开发
浙江音乐学院 音乐工程系主任-段瑞雷
主持人:小旭音乐 CEO-卢小旭
卢小旭:我是小旭音乐的卢小旭,我们是一个 AI 音乐专门的自媒体号,也是伴随着这两年 AI 技术的大发展走过来的。今天我看我们现场来了很多的漫剧公司,不知道大家对于 AI 音乐这个非常重要的环节有没有研究。台上的四位嘉宾呢,我们首先请每个人先简单介绍一下自己的身份,然后聊聊自己的产品或者团队在 AI 音频的哪个领域。我们先从姜总开始吧。
姜涛:大家好,我是姜涛,来自自由量级。我们的产品是“音潮”,是一个国产的音乐大模型。我们在春节前也刚刚发布了我们音潮 3.0 版本,它在音乐性、音质、编曲旋律等各个维度,在全国都是一个 T0 级别的状态。大家在各个应用市场,搜声音的“音”,潮水的“潮”,都能体验到。其实我们整个团队有一个共同的理念,就是希望每个人都能用音乐记录生活、记录情感,我们也希望我们的产品能够帮助大家实现这个夙愿。
赵文骁:大家好,我是赵文骁,来自 ACE Studio。我们是一个 AI 原生的音乐创作工具,现在大概有超过 100 多万用户了。这其中有格莱美获奖者,也有普通的音乐爱好者。我们近期也开源了一个音乐模型叫 ACE 1.5,所有的权重全部都开放下载,大家也可以去看一下。另外呢,我们最近也在新开发一个项目叫 ACE Music,它是一个更加开放的平台,大家在上面可以用到各种各样的音乐模型去创作,然后分享自己的音乐作品。
宋开发:各位同行好,我是来自成都素动科技的宋开发。我们是一家出海的公司,主要是赚美金的。今天来的很多朋友应该都是我们的合作方或者伙伴,我们主要的话,就是用 AI 把声音做得更像真人。现在的短剧出海、影视制作营销,把声音配成国外的一些主流语言,是现在我们主要在做的业务。所以我们今天过来也是多学习,我们 99% 的用户都是海外的,有印度、德国、意大利、泰国等,国内的短剧出海公司也是我们主要的用户。
段瑞雷:大家好,我叫段瑞雷。我来自浙江音乐学院音乐工程系,我本人跟卢老师一样从事数字音乐创作。音乐工程系这个名字在音乐学院可能看起来比较特殊,是在音乐学院里从事数字音乐相关的教学和人才培养的专门的系部。
探讨一:2026年 AI 音乐版权市场的变化与创作者权益
卢小旭:我们这四位嘉宾覆盖了 AI 音频的方方面面,有做 AI 音乐大模型的,有做 AI 音乐一站式工作站的,然后宋老师是做语音出海的,段主任呢是代表音乐教育领域,代表了不同的方向。所以下面的问题呢,可能针对大家不同的领域会有一些区别。首先想问一下姜总和赵总两位,今年 2026 年其实在 AI 音乐这个行业最火的概念是什么呢?是 AI 音乐的版权。AI 音乐的创作者越来越多,包括台下的朋友可能不是音乐科班出身的,但也能用 AI 来写歌,那出来的音乐怎么赚钱?面对着现在 Suno 上面每天几百万首的 AI 音乐作品,国内的版权制度各个平台也在慢慢健全,想问一下二位作为 AI 音频工具和大模型的代表,怎么看 2026 年在 AI 音乐版权这块市场上的变化?
姜涛:其实我们在谈版权之前,更早一步应该看是否承认用户的音乐创作权,我觉得在这一点上大家都是有共识的。因为用户加了自己的 Prompt,加了自己的想法和脑洞,同时不断去打磨这个产品,他有了自己的投入和心血,那么这个 AI 音乐作品的创作权,我觉得首先是要被承认的。然后再来谈版权的问题。既然谈到版权可能有一些历史的几座大山,我们永远是翻不过去的,但是在不绕过大山之后,我们再看现在大家对 AI 音乐作品的消费程度是极高的。尤其是对很多二创类的作品,比如我看了一个《凡人修仙传》的衍生二创演唱会,给一个角色配了十首歌,将近 60 分钟的演唱会,其中有些作品还是很不错的。它在 QQ 音乐、网易云音乐的播放量都很高,而且评论数也很高,说明用户是喜欢这类作品的。那么这个作品既有创作权,用户又喜欢,接下来如何让用户得到合理收益,这就是平台需要想办法的问题了。如果流媒体平台能满足用户的收益又满足创作,那创作者一定会流向这些平台。我们看到有些流媒体平台现在拒绝给 AI 作品结算,有些平台是结算的,现在结算的平台最近月活有了 80% 的增长,这也是有目共睹的,用户会用脚投票。
再一点呢,像我们音潮或者 ACE,大家都是承认用户的创作权以及相关的一系列版权的。有些平台其实被大的版权方做了一些捆绑,导致创作者作品的版权被分离变更,这也是所有创作者面临的窘境:“我究竟要不要在这个平台去创作?我创作了好的作品,有可能版权还不属于我”。那创作者自然会流向一些对版权更加宽松、更加保护创作者的平台。像我们音潮的 license 里面就明确说,所有创作的版权归属用户,平台不占有。同时我们还能够出具各种日志和证明文件,证明用户在什么时间点输入了什么 Prompt 创作了这个作品,创作权属于他,这是一个权利保护的状态。
赵文骁:刚才姜总说的已经非常全面了。关于版权这块,其实最开始主要就是为了保护创作者的创意和他的工作成果,因为创作是一个非常费时费力的过程,但是复制非常简单。所以最早的版权可能就是卖 CD 和磁带分一部分钱,后来的流媒体就是根据歌曲的播放量去给你分钱,本质上都是要保护创造者的权益。ACE 最开始其实不是一个完全端到端的 AI 音乐生成工具,而是一个创作平台,让创作者去借助工具生成内容。所以说里面融入了创作者心血的东西,我觉得肯定是需要去保护的。
另外就是关于模型拿数据训练这件事,最近有很多的讨论。其实我们做得比较早,我们之前有 AI 歌声。我们的做法一方面是数据采购,自己采购或者请人来录制;另一方面我们会跟一些有名的乐手或者歌手合作,推出他/她的虚拟音源或者虚拟乐器。然后用户在平台上使用的时候,我们最后也会按照使用量去结算,给这些艺术家进行一定比例的分成。所以我觉得未来,假设有一类模型是基于某个艺术家风格的蒸馏或者 Lora,在使用过程中可能也是要对艺术家进行一定比例的分成工作的。刚刚姜总说现在的主流流媒体可能不接受 AI 音乐的版权,但我觉得这块未来会越来越放开。包括我刚才说的 ACE Music 也是一个比较开放的平台,只要是凝结了大家创作心血的东西,我觉得都是可以拿到回报的。
卢小旭:关于版权呢,其实用户是用脚投票的,只要好听就行了,不管是人类创作还是 AI 创作。现在其实很多数据已经显示出来了,AI 创作的歌,听众的点赞数可能会更高。
探讨二:AI 时代还需要学习音乐和乐器吗?
卢小旭:下一个问题问一下段主任。因为我作为视频号的博主,看我视频留言最多的就是学生和老师,很多人都说 AI 出歌已经非常方便了,那我们还需要学音乐吗?还需要学乐器吗?怎么用 AI 去辅助学习?我相信这也是您在教学过程中面对 AI 的一个巨大挑战,不知道段主任是怎么理解这个问题的呢?
段瑞雷:这也是这两年摆在我们面前的一个很严肃的问题。我们是这样思考的:我们首先应该把音乐理解为一个名词还是一个动词?我更倾向于把它理解为一个动词。如果它是一个动词的话,就是我们参与音乐、介入音乐,不管是欣赏行为还是创作行为,我相信 AI 是给大家提供了更多方便的。基于这一点,在以前,我们还在讨论怎样防止学生用 AI 作弊,但现在,所谓的“作弊”问题我们觉得已经不是问题了,他用得好就可以了。那么还要不要学音乐这件事情呢?我们回到对待音乐的行为上来看。
我们系主要的培养方向还是音乐的创作和制作人才,我们一直在给学生们强调一个观点,就是“好的东西永远是聪明的人花笨功夫做出来的”。哪怕 AI 再先进,不同的人生成的音乐品质还是良莠不齐,而且音乐还不像视觉类的作品你能一眼看一百个,它是时间的艺术,生成了 100 分钟,你就要花生命中的 100 分钟去听它。所以对于音乐人来说,花笨功夫把 AI 结合自己对音乐的理解和审美,为大家推荐或者是生产一些优质的音乐内容,这项任务对我们来说是永远存在的。
卢小旭:段主任刚刚提到一个“审美”非常重要。我自己的孩子八岁,小学三年级,要不要学音乐?必须学,而且越早越好,乐器能学多少学多少。为什么?不是为了我们要能够创作音乐去跟 AI PK,而是要建立我们自己的审美。AI 一分钟能给你出 100 首曲子,你能很快从中挑出你觉得最好的曲子吗?所以审美是需要从小去建立的,非常重要。
探讨三:配音出海与 CV(配音演员)权益的平衡
卢小旭:下一个问题问一下宋老师。最近大家看新闻比较火的一个新闻是什么呢?是很多知名的配音演员发声明,捍卫自己的声音权利,抵制非法 AI 的声音克隆,我看央视也下场在报道了。作为 AI 语音出海领域的专家,想问一下宋老师,怎么去平衡 CV(配音演员)合法权利和 AI 语音未来发展之间的关系?不知道宋老师这边是怎么做的。
宋开发:我们在全世界有 200 多万用户,目光主要在海外。我先结合海外和音乐相关的讲一讲,再讲国内的。其实全世界很多国家的数字内容供给没有中国、北美这么发达,比如我们看到的中东和欧洲很多国家。比如有些黑人说唱讲得很好,但他想把自己的口音变成标准美式英语或澳大利亚英语,让音乐能够更好传播,他们就会让我们提供翻译加配音的服务,为此付费还挺多的。包括像希伯来语的音乐翻译成英文,还要保留原有音调,一分钟他可能付 100 甚至 1000 美金。所以我们看到海外这方面的机会是非常多的。
回到国内的话,我们也观察到国内的配音演员对 AI 有一种矛盾和冲突。其实对比翻译行业是一样的,AI 取代了很多基础翻译工作,但是高端、资深的翻译依然很贵、很有价值。说到配音这里呢,现在国内大量用 AI 做短剧出海,主要是降本增效。经常有人问我一天能产 1000 分钟还是 5000 分钟的翻译配音,把中文翻译成西班牙语、泰语、阿拉伯语给海外看,这种其实是质量稍微低一点的跑量。但是我们看到真正的海外大客户,像马来西亚大的数字媒体,他们要把动画片配音成印尼语,听了 AI 之后觉得不行,他们愿意付很高的价钱找真人来配。
所以如果没有很强自我风格的基础配音演员,确实在这个行业里会受到很大冲击;但是对于专业的资深配音老师,在我们的业务规则里:你说过的话,我才去翻译配音;你没说过的话,我们是不会去配的。比如有用户过来想找某个明星克隆讲一句话,如果他没说过,我们是不接这样的业务的,这就保护了高级别配音老师的权益。我跟很多导演也交流过,很多高质量产出即便用了国际上的 ElevenLabs、国内的 MiniMax、科大讯飞或是通义千问等模型,好内容依然需要找老师来配。因为极短时间内“我要哭、我要闹、我要吵”的这种极致情绪,AI 在 0.1 秒、一秒以内是搞不定的,这种短暂的爆发是我们人类能搞定的。所以在未来,资深的配音老师可以多跟一些机构合作,去了解并保护自己的权益,这也能促进整个行业的发展。多数 AI 还是在做短剧跑量,真正核心的导演拍大电影,多半还是得用老师的真人配音,不会用 AI。
卢小旭:宋老师说得非常好,我也有感触。我们一直给游戏做配乐配音,现在游戏里面 80% 还是得真人配,因为这种强情绪赋予、人格化的 AI 配音还是稍微欠缺一些。但我觉得随着技术发展可能会越来越强,不过人类所赋予的情感是不可替代的。
探讨四:国产 AI 音乐工具的优势与“竞品”生态
卢小旭:下一个问题还是问姜总。我们一谈到 AI 音频工具,肯定会想到 Suno。作为国内头部的 AI 音乐模型,怎么去跟 Suno 对标和竞争,或者说怎么翻过 Suno 的这座山?包括 Suno 出了 Chat agent 功能,不知道姜总去看我们国内 AI 音乐产品的优势在哪里?
姜涛:Suno 在整个行业里面确实是一个领头羊的状态,无论是模型效果还是产品功能。像你刚才说的 Audio 的功能,其实最早还不是它出的,而是被 Google 收购的 Riffusion,他们最早做了这样的模式,我们的出海小产品 hitto.ai 也在用这种模式。但我想说一点,我们跟 Suno 并不是竞争的关系。Suno 的端侧越来越面向专业的音乐人,包括 Studio 里面的功能也越来越复杂。但是音乐除了专业的音乐人之外,还有广大的大众,还有其他的场景。这是一个很大的市场,很多受众的音乐生产和消费诉求还没有被满足,比如影视剧、游戏等还有这么大的市场空间。所以我们觉得完全没有必要在创作工具领域去跟 Suno 正面硬刚,我们还有更多的其他用户群体去满足。大家一起把这个市场做大做强,我觉得这才是最重要的。在当下的技术迭代中,虽然希望能达到 T0 的状态,但我们更专注把我们音潮模型在 IP 音乐、影视剧等场景的收益最大化,大家在自己擅长的领域做到最好。在底层技术迭代过程中,作为 CTO 我还是希望看到模型越做越好,能从中吸取一些技术思路。从 23 年 Suno 的 Bark 模型开启一个时代,到现在它一直在引领,但在引领中能不能实现收益最大化不好说,因为每个国家有地域与文化的差异。在满足自己熟悉的文化人群的情感价值之后,我们会得到不同的收益。所以希望 Suno 越来越好,我们也希望自己在路上走得更好。
卢小旭:问一下赵总,ACE Studio 主要面对的是专业或半专业的一体化音乐工作站,那还是会提到与 Suno 的对比。虽然 ACE 在国际上影响力越来越大,越来越像一个国际化的 DAW 音乐制作产品,但在这两点上(对标和国际化策略)ACE Studio 的战略思路是什么?
赵文骁:其实我们很早就注意到了,Suno 最开始模型叫 Bark,当时我们做 ACE 其实追求的是高可控的,有 AI 人声和很多辅助创作人的小工具;而 Suno 当时只是端到端地输入 Prompt 输出一首歌。随着时间的发展,Suno 也不可避免地在向可控性这边倾斜,而我们也在做音乐大模型,所以说最终确实是一个竞争关系,这是不可避免的。
我们的策略是这样的:首先对于模型来讲,肯定不是一家独大统治天下的。大家可以看现在的大语言模型,比如 OpenAI 原先是统治天下,但现在也出来很多厉害的模型,比如 OpenClaw 这些。不同的模型有不同的特点,未来有些模型可能更擅长古典,有些可能更擅长摇滚或者流行,大家在创作的时候可以根据需要选择不同的模型组合,产生最佳作品。还有一个就是我们采用了一个开放的策略。可以回想一下,当时 Midjourney 是闭源的,而 Stable Diffusion 是开源的图像模型,但是 Stable Diffusion 开源带来的生态蓬勃发展是 Midjourney 没法比的。后面演化出上万个 Lora、ControlNet 等控制插件,结合 ComfyUI 工作流可以产生出单一闭源模型达不到的效果。现在 ACE 也是采用了这样的策略,开源了所有的权重,支持大家去炼自己的 Lora,ComfyUI 社区也第一时间对我们做了支持。最后,要产生一个真正的作品,还是要靠人,人类有自己的文化理解,而模型的东西是固化的,所以音乐要发展,最后还是靠所有的人去多方位创作。
探讨五:视觉模型“音画同出”对音频行业的冲击
卢小旭:接下来一个问题问宋老师,可能略带尖锐,因为今天来的漫剧公司很多。类似于 Sora、可灵这种“音画同出”的视频模型对我们冲击很大,以前我们公司做音效配乐,现在它音画同出就没我们太多事了。那会不会对 TTS(文字转语音)这样的工具有一定的影响?怎么避开这些未来视觉大模型把音频一起吞掉的可能性?
宋开发:我们的观点是,看到全世界其实很多内容因为语言的障碍没有进行传播。如果配音老师在中文领域受限比较大,可以往多语言方向发展,比如做粤语、藏语、新疆语的配音需求非常大,但好老师往往不懂这些语言。所以回到这个问题,我们接触到全世界非常多已生产的内容需要语言翻译和配音。比如 YouTube 支持多语言,很多大博主用我们的 TTS 服务把内容配音后发给全世界看,发音会更真实。
现在像 Sora 或可灵这些“音画同出”的模型,它针对的是增量内容、新内容,可以直接生成配音。但是对于已有的海量存量内容,因为需要很好地理解当地文化、翻译本地梗、用语气词进行润色,大模型还是很难满足的。所以在短期或中期内,大模型对我们这类翻译配音工具的影响是非常小的。另外,对于提前构思好并想要精确控制声音的内容,大模型可能没法满足要求,反复抽卡的成本就高了,还不如直接找人配或者用 TTS 去配,拆开来制作成本反而更低。所以大模型对内容生产有极大的提高,但对传统需求影响不是很大,现在的机会还是很大的。
卢小旭:解释得非常清楚啊,一个是存量,一个是增量。可灵的音画同出主要对增量内容,但大量的以前已经做好的视频,如果再用原始真人配成本受不了,所以就要多用宋老师的产品。
探讨六:AI时代下的音乐教育与未来趋势
卢小旭:下一个问题问段主任,我们刚才问了从学生端怎么去学,那肯定就要问从老师端怎么去教。因为四月份上海杨浦区教育局叫我去给全市一百多个中小学音乐老师做 AI 培训,我觉得压力很大。老师们该怎么去用 AI 进行音乐教育的辅助和提升?在这块段主任有什么样的计划或看法?
段瑞雷:谈谈我的理解。音乐学习分为两类:一类是知识类的学习,一类是技能性的训练。在知识性学习上,因为大语言模型天然的优势,很多已经被重构了,传统课堂一个学期的知识内容可能很快就能完成。但在技能训练部分,我暂时至少还没有发现特别好的产品能够代替老师监督练习。比如运弓的角度、下键的力度和手指各种机能的训练,可能还没有一个特别好的工具。延伸一点思考,回到教育本身:教育本质应该是一棵树去摇动另一棵树,一颗心灵去触碰另一颗心灵。在学习过程中,老师的言传身教、他的情感色彩、在你身边的陪伴、鼓励以及批评,我觉得目前我还没有看到 AI 能够代替的可能性,因为人的本质还是人。
卢小旭:学乐器的时候,孩子弹错一个音,老师的一个抚摸传达出的人类情感或鼓励,目前的具身智能我觉得之内还是很难去替代的。但是在工具和知识层面确实是有机会的,目前还没有特别好的辅助教学产品,这对于创业者也是机会。怎么利用 AI 学好音乐对于老师和学生都非常重要。
卢小旭:最后请每位嘉宾简短总结一下。今天台下大部分是非音乐专业人士或 AI 爱好者,在 2026 年大家应该怎么玩转 AI 音乐?以及 26 年以后 AI 音频整体市场的发展趋势是什么?
姜涛:在做音乐大模型的领域大家有一个共识:三五年后人们消费的新音乐,可能大部分都是由 AI 辅助人来完成的,百分百的“古法音乐”可能就不多了。但最有创意、脑洞最大的那部分肯定还是由人类中优秀的创作者来完成的。中间那部分作品 AI 已经能搞定了,大家更买单的将是音乐作品是否满足情绪价值。我对 AI 有比较深的信仰,见证了它从起初唱得乱七八糟,到后来智力涌现唱出优美的歌声,所以我相信到 2026 年,大家要学的就是如何跟 AI 共同进步和成长。它几乎是一个多边形战士,更多取决于创作者需要什么样的场景和情感表达。大家百分百相信 AI 能完成,只不过当下的时间成本和算力成本可能略高,未来会逐渐降低。今年是一个非常重要的学习过程。
赵文骁:我之前是做技术的,可以从 AI 代码趋势看出来,以前写代码很复杂,配置环境和学习理论需要很久;但现在你跟 Agent 提需求,它就能帮你做出功能。音乐也有这样的趋势,原先制作音乐需要下载复杂的 DAW、音源和效果器,学习冗长的工程知识;未来的创作可能只需基于审美,让 AI 生成后,你再根据自己的想法一步步打磨修正。创作和消费的过程会变得越来越模糊,可能听歌时觉得怎么改更好,马上就能转变成创作。未来创作会非常有趣,也会涌现出更多不同风格的作品。
卢小旭:两位的产品偏向 2C,宋老师是在 2B 领域,简单谈一下 2026 年以后语音配音领域的发展趋势。
宋开发:翻译和配音在国际上叫本地化(Localization)。在翻译本地化高效低成本的前提下,它能助力文化的输出,比如将中国故事、武侠修仙故事走向一带一路甚至更多地区。我们讲出自己的故事,双方的理解会更深。从去年到今年,来自国外的订单越来越多,外国机构也发现中国内容生产能力强,直接找我们做其他语言的本地化配音。未来深入国家文化领域做好本地化配音的需求会越来越大。比如大型跨国企业给员工培训,也逐渐从统一英语变为提供个性化的本地语言音频服务。AI 带来了更多语言本地化的需求,未来 B 端机会非常多,很多翻译配音机构现在每天都在加班,这是一个很好的机会。
卢小旭:最后问一下段老师,台下的家长怎么在 AI 时代帮准备考音乐专业的孩子做准备?校企合作方面有什么计划?
段瑞雷:随着 AI 技术与经济的发展,一部分人慢慢不再把音乐当成单纯糊口的饭碗,而是会真正回归音乐艺术本身。真正喜欢音乐、善于音乐、适合从事音乐的人,会慢慢留在这个行业里。校企合作方面,高校最重要是育人,我们非常重视与前沿企业的合作。企业的研发紧迫感比高校强很多,如果学生对企业研发方向和产品感兴趣,我们会积极把他们推向产业。也请企业界的朋友多来我们浙江音乐学院这挑人,我们有很多才华横溢的学生,期待与大家多合作!
卢小旭:最后总结两句。音乐是艺术很重要的表现形式,往往容易被忽视。大家看到 AI 视频赛道已经卷成麻花了,但 AI 音频产品并不多,希望有产品能力的团队能够多在 AI 音频的细分领域发力。俗话说“好戏没有声音也出不来”,台上的嘉宾代表了学界、语音出海、音乐大模型及工作站等领域,希望大家下去后多交流。感谢各位嘉宾的分享,也感谢大家参加今天的论坛,谢谢大家!