Elektrine lite

← Feed

@zonble@g0v.social

Post #3906905

2026-07-18 09:04 UTC

https://youtu.be/3DWgDSo3a_w?si=CgZm0cfPwxFgnKFA 好像身邊玩 Google Flow Music 的人比較少,來聊聊玩到現在做出了怎樣的東西,還有玩這個 AI 的時候踩了什麼坑,或是說,一些眉眉角角。 我自己會把 Flow Music 的功能分成三塊—產生音樂、產生 MV,裡頭還有一個 Vibe Coding 的工具叫做 Spaces,可以用來做音樂播放器、歌詞的網站,但真要做 Vibe Coding,比 Flow Music 強大的工具太多了,我不覺得大家會想拿他做網站。相信應該主要還是拿來做歌曲還有 MV。 跟之前在玩的 Suno 比較,在 Suno 裡頭大概沒按下滑鼠幾下,就把每天的限額用完了,但是玩 Flow Music 的時候,一直沒有遇到每天歌曲產生的上限。 在產生歌曲的過程上,Suno 是讓你直接下 prompt,自己輸入要產生的曲風、歌詞(編輯器裡頭也有 AI 可以幫忙),Flow Music 裡頭則有一個叫做製作人的 AI chatbot,互動方式就變得不太一樣—一首歌變成是在與 AI chatbot 的聊天對話中不斷成形,也可以用比較含糊的用語對話,例如,我可以說「我想要一個 90 年代初期的流行歌的感覺」,AI 製作人就會挑一個他知道的 90 年代音樂類型幫你下 prompt,你聽了覺得不對,好像有點 80 年代、而不是 90,也可以直接跟他說,讓他再幫你挑個風格出來,但製作人所下的 prompt 不見得跟最後產生出來的曲風一致就是了。 比較討厭的地方是 Flow Music 有違禁詞機制,他禁止的不是特定政黨或是政治團體方面的,而是什麼自殺、藥物濫用之類的主題,而有一些比較灰暗的或是社會批判的歌詞也可能被擋,我有一首歌的歌詞是「在他鄉被別人排擠,在故鄉被自己人壓迫」,結果「排擠」跟「壓迫」,都被擋了下來,連那個製作人 chatbot 都在說,這種內容到底有什麼好擋的。 Flow Music 有兩個我很喜歡的功能,一個是可以把寫出來的歌分成多軌下載—他可以把人聲、樂器、Bass 跟鼓拆成不同音軌下載,所以在產生一首歌之後,你可以把不同音軌丟進 audio editor 重新處理,像是只保留鼓跟樂器,人聲的部分自己重唱。 另外就是可以部分取代,像是一首歌產生完之後,有個字唱錯了,你可以要他哪幾秒到哪幾秒之間重唱,而不是整個重新產生—重新產生就變成一首新歌了,但很多時候是已經有一個你喜歡的版本,你想要對局部繼續打磨。我有一首歌,有一段歌詞是中文,但我希望那一段換成日文,就可以用這個功能做到。 說到多語言,他在處理多語言的時候還是很容易犯錯,像是中文日文夾雜時,就很容易把日文漢字也當成中文來唱,這時候比較好的作法是歌詞裡頭所有的日文都只寫假名。而在唱某個語言的時候,往往也會用一個針對某個語言的主要模型來唱,讓這個模型唱另一個語言時,聽起來也會很怪,就得下很多額外的 prompt 來約束用怎樣的聲音。 產生歌曲大概都用不到錢,如果想做 MV 的話,那 token 就燒得很快,而且眉角更多。他可以讓你選擇要用橫的還是直的影片,以及要不要上字幕—不要讓他上字幕,他的字幕沒有中文字體,所以中文都會變成方塊。而產生影片的過程中,很容易產生失敗—失敗他就不會跟你收錢就是了。 一部影片如果太長(最近嘗試到的經驗是超過半分鐘),而且畫面太過複雜,大概沒多久就會跳出失敗訊息。我本來想做一首青春搖滾,要他模仿一靜到底的拍攝風格,一群少年在教室走廊奔跑,跑一跑拿起樂器,跑到操場上,跟著一大群啦啦隊一起跳舞,結果就一直失敗。就算成功,他有時也會跑出一大堆無意義、不知道在幹嘛的影片。 山不轉路轉,既然知道他的特性,我們就去找比較容易成功的路徑。既然我們知道影片太長容易失敗,那就跟 AI 要求只要某個時間區間,大概十多秒到三十秒左右的影片;既然容易有無聊的畫面,那我們就根據同一段時間,先後產生兩個版本,後面再另外找一套剪輯軟體,像是 mac 上的 iMovie ,將兩段影片快速交叉剪輯,只保留有意思的部分,爛的部分丟掉—反正 MV 也很常這樣快速剪輯。 這種特性剛好就符合我想要的效果—我想做一首很鬧的歌,但是同一段歌詞,第一次唱跟最後一次唱,其實意義是不一樣的,而這個意義區要透過影像來賦予—場景不斷轉換,最後到達一個一開始想像不到的地方。 中間還是有一些地方讓人不是很滿意,因為影片是分段產生,所以裡頭無法維持人物的五官一致,只能透過一些鮮明的特徵來維持;如果要產生跳舞的影片,動作也很機械,就得靠快速剪輯來藏拙。而 Flow Music 產生出來的影片往往速度感也不夠,如果要一些什麼飆車的畫面,也得靠在剪輯軟體裡頭快轉。 做出來的東西有點像是在挑戰目前的 AI—或是我使用 AI—可以玩到哪裡。首先是歌詞裡頭直接混合中文、德文、日文,看看 AI 會唱成怎樣,成果是聽起來還像是同一個。裡頭的歌詞其實不少擦邊球(還是很直白)的黃腔,看看會不會被擋下來。然後是可以產生多複雜的歌舞與場景—話說如果不是 AI,想要整個操場都是啦啦隊、八家將跟女僕一起跳舞,甚至最後在管線脫落、一片荒蕪的保齡球館唱歌,應該都是現實中拍不到,或是成本直接爆炸的不可能任務。

Replies (0)

No replies.