大数跨境

一个人就是一家唱片公司:做歌成本归零之后,什么变贵了

一个人就是一家唱片公司:做歌成本归零之后,什么变贵了 AI造万物
2026-09-29
23
导读:AI把做歌的成本压到了零,但没有把「做一个好东西」的成本压到零。它只是把那笔账,从一个你付不起的地方,挪到了一个只要你肯投入就付得起的地方。

一个人就是一家唱片公司:做歌成本归零之后,什么变贵了

素材说明:本文为个人 AI 音乐生产实践的第二篇(上一篇讲工程踩坑,本篇讲设计与判断),
 所涉流程、参数、取舍均为实际操作记录,不涉及任何收益数据,亦非产品推广。


01 五十个文件,和它们背后真正的问题

先给一个直观的量级。

一个系列做下来,磁盘上的交付物是这样的:每首歌 5 个文件——普通话音频、藏语音频、两份歌词、一张封面。一个二十来首的系列,就是一百多个成品文件。

如果这些东西交给你手工做:登录平台、粘贴歌词、等生成、点下载、重命名、上传下一首……按每首歌十分钟算,只是重复劳动就得小半天。

而现在是几条命令。中间断网、浏览器崩了、超时了,重跑同一条命令就能接着走。

但我想说的不是"我做了多少"。我想说的是做完之后我发现的一件反直觉的事:

当生产一首歌的边际成本趋近于零,稀缺的东西并没有消失,它只是换了个位置。

下面四节,讲它换到哪儿去了。


02 第一件事:双语版本几乎不要钱

这个系列每首歌都有普通话版和藏语版(或藏汉混唱版)。

在原来的生产方式里,这意味着什么?意味着双倍的词曲、双倍的录制、双倍的预算。绝大多数独立创作者到这一步就停了——不是不想做,是做不起。

而现在,第二个版本只是"同一份歌词流水线再跑一遍"。增加的是机器时间,不是人的时间。

这才是真正的变化:不是快了,是原本做不到的选项,现在能选了。

顺着往下一步想,你会发现一个更大的东西:系列化企划才成为可能。

单首歌思维和多首歌思维是完全不同的两种创作。单首歌要考虑"这一首能不能爆";而当你确定自己能稳定产出二十首的时候,你可以开始考虑:这二十首之间的顺序是什么?情绪曲线怎么走?哪几首应该相邻,哪几首必须隔开?

手工时代,只有唱片公司的企划部会想这个问题——因为只有他们有资源把它落地。

现在一个人也可以想了。


03 第二件事:真正的人工智能,藏在歌词那条红线里

这一节是全文最想说的。

很多人以为 AI 做歌的难点是把歌词写长。恰恰相反——写长最容易,写对最难。

这个项目里有一份明文写死的规范,我把它抄一段出来(原文):

这是佛教证道歌,必须保持严肃性和专业性。
 之前有一版《瑜伽饮酒歌》写成了戏谑小调,被明确要求返工重写。

请注意这个成因:不是 AI 写不出来,是 AI 写出来了一版戏谑的,然后被人否掉了。

那份规范里还有一组对照样例,我觉得值得全文引出来——比任何理论都清楚:

✗ 酒肉穿肠过 佛祖心中留 喝他个痛快 ✗ 修行嘛 就是躺平嘛 别卷了兄弟 ✗ 嘿哟嘿哟 念经真累  ✓ 以酒喻空乐 饮的是觉受 醉的是执著 ✓ 荨麻煮水就是我的羹汤 ✓ 灯传给了灯 火传给了火 

看出区别了吗?

右边这三句之所以成立,不是因为用词更华丽。恰恰相反——它们更朴素。区别只在于:它知道自己在一首什么歌里。

那份规范很朴素地把「戏谑、调侃、网络梗、口语化吐槽」列为禁止项,再补上一条语气要求——恳切、笃定、悲悯。然后再加一条我以为很有意思的规定——"一首歌只承载一种情绪"(圆满 / 悲悯 / 决绝 / 叮咛),不要在一首里忽悲忽喜。

还有一条我认为最有分量的:佛法语汇要朴素准确,不要用自造的、似是而非的伪佛法词。 用词必须是「觉受」「菩提心」「无常」「上师」「本尊」「空乐」这类本来就有出处的。

这几条加起来,指向同一件事:AI 最不缺产量,缺的是判断它该在哪条路上走。

而且这份判断没法自动化。你只能把它写成字,钉在规范里,每次生成前先读一遍。

当生成变得不要钱,"不做什么"反而成了唯一的创作行为。


04 第三件事:二十张封面,怎么看起来像一个画师画的

AI 生成单张图很容易。难的是生成一套。

二十张独立生成、互不相关的图摆在列表里,一眼就能看出是拼的:有的暖有的冷,有的是写实有的是插画,字体和排版毫无关系。这种"每个都很精致、放一起就散架"的感觉,是 AI 做系列内容最常见的失败模式。

解法不复杂,但需要在一开始就定死。我用的是三要素:

一、画面要具体到能画出来。 不是"宁静的雪山",是"红崖岩洞的洞口、风里的经幡、远处戴雪的喜马拉雅山峰、一只大鹏盘旋在崖顶"。

二、色板要锁定。 整套统一用唐卡矿物色:deep crimson, ochre, indigo, gold leaf, turquoise。明确避开两样:高饱和塑料感、现代摄影棚打光。

三、氛围词也要锁定,并且和歌曲情绪对齐。reverent(虔敬)、contemplative(静观)、austere(苦寒)、luminous(光明)——每一首按情绪选一个。

然后是关键的一步:所有提示词共用同一条尾巴。

Traditional Tibetan thangka aesthetics blended with cinematic realism, mineral pigments, painterly detail, sharp focus. No text, no letters, no watermark. 

这条尾巴才是二十张图能放在一起的原因。它相当于给这个系列雇了一个固定的美术总监——每个人都知道用色、笔触、景深的标准是什么。

底下还有一层工程细节:AI 底图出 1536×1536,然后由脚本缩到 2048×2048,用微软雅黑 Bold 叠上中文曲名、用 Light 叠拼音,底部三分之一压一条渐入的黑带,完全盖住 AI 自己的水印。

(这里有个批量生成特有的坑:同一秒发起的多个任务会拿到同名输出文件互相覆盖。曾经一批二十张底图里有四对撞了车,画面和曲名完全对不上。所以每批生成完我都逐张打开核对。)

这套方法跟是不是 AI 无关。任何要做系列视觉的人——专辑、播客、短视频封面——用的都是同一个道理:先定规矩,再作画。


05 第四件事:只剩一步不能自动,而那一步恰好是责任的边界

上一篇文章里我写过,整条链路自动化到最后,唯一做不了的是短信验证码。

平台的合同签约需要手机验证码,这串六位数字进不了脚本。我的处理办法是:脚本自动点"获取验证码",然后每 4 分钟自动重发一次,总共等 30 分钟——所以你什么时候回到电脑前,手里的码都还是有效的,把码写进一个本地文件,它自动填、自动签。

当时我把它当成一个技术障碍来写。现在回头想,它其实另有含义。

提交作品是机器可以做的,签合同不行。

签字这个动作意味着:有人为这批内容负责。平台把这一步留给人,不是技术做不到,是它必须确认有一个真实的人在这个位置上。

这一点比任何功能都重要:自动化能帮你把一件事做到极致,但它无法替你承担后果。 越是把整条链路都跑通,最后那一步的分量就越重。

顺带说一句这个行业的规矩:平台要求明确标注是否为 AI 作品。这个字段我是如实勾的。这不是负担,是这个游戏能持续下去的前提。


06 所以,什么变贵了

回到开头那个问题。

以前做一首歌,贵的是设备、是录音棚、是会乐器的人。这些现在都不贵了。

现在贵的,按顺序排,我认为是这三样:

第一,知道该做什么。 一个系列二十首歌的顺序是什么、情绪曲线怎么走——这是企划能力,机器不会有,它只会一首一首地生成。

第二,知道不该做什么。 那份被返工的《瑜伽饮酒歌》是最好的例子。AI 可以无限量地生成"还行"的东西,而分辨"还行"和"不对"的能力,才是这个时代真正的手艺。规范里那句"一首歌只承载一种情绪",写起来只有八个字,守起来要听很多遍。

第三,愿意为结果负责。 这是第四节说的那个按验证码的动作。

这三者有一个共同点:它们都不随产量摊薄。

产出一百首歌不会让其中任何一样变得更简单。恰恰相反——产量越大,这三样越贵。

所以这整套东西最诚实的总结其实是:

AI 把做歌的成本压到了零,但它没有把"做一个好东西"的成本压到零。它只是把那笔账,从一个你付不起的地方,挪到了一个只要你肯投入就付得起的地方。

机器负责把事情做完。剩下的,还是你的。


文中所述为个人环境下的实践记录,各平台页面与规则可能随时调整,请以官方说明为准。

【声明】内容源于网络
0
0
AI造万物
科技改变生活。
内容 24
粉丝 0
AI造万物 科技改变生活。
总阅读3.1k
粉丝0
内容24