先講一個我最近在客戶帳戶裡看到的事。我分析了十二個美國 DTC 品牌的 Google Ads 廣告文案,涵蓋美妝、保健品、家居用品。這些品牌彼此是競爭對手,照理說語氣、訴求、品牌個性應該天差地遠。結果呢?我把它們的標題丟進 embedding 模型做語意向量分析,平均成對餘弦相似度高達 0.87。白話一點講:在機器學習模型眼中,這十二個品牌的廣告語言幾乎是複製貼上。你以為你在跟對手搶消費者,其實你們連說話的方式都已經同化了。
這不是科幻情節,是正在發生的事。而背後的原因,跟我們每天在用的 AI 廣告文案生成器脫不了關係。
表面上看起來,AI 文案沒什麼問題
先澄清一件事:我並不反對用 AI 寫廣告文案。我自己的團隊每天都在用,效率提升是真的。以前寫二十組 Google Responsive Search Ads 標題加描述要兩小時,現在五分鐘就能生出五十組,文法正確、結構清楚、CTA 到位,甚至比很多初階文案寫得更好。單看一則 AI 生成的廣告,你很難挑剔。
但問題從來就不在「單一文案」好不好。問題出在當所有人都用同一批基礎模型、類似的 prompt 模板、甚至直接套用工具內建的「最佳實務」建議,整個市場的廣告語言會開始急速收斂。你以為你生成了二十組「不同」的標題,但在 embedding 向量空間裡,它們跟競爭對手的二十組可能高度重疊。單看每一則都合理,合在一起就是一場語言的集體平庸化。
廣告語言特徵正在經歷「熱寂」
Google Ads 與 Meta Ads 的排序模型,本質上是從數十億次曝光、點擊、轉換訊號中,學習哪些語言特徵能預測使用者行為。這些特徵包括語意、情緒強度、句子長度、關鍵字密度、CTA 形式、標點符號出現模式,甚至大小寫的習慣。
過去人類文案撰寫者的語言風格極其多元。有人喜歡長句堆疊情感,有人偏好短句製造節奏;有的品牌走幽默路線,有的走權威路線,有的走極簡路線。這些多元的語言特徵在語意空間中分布廣泛,提供了充足的「訊號熵」,讓廣告平臺的模型有足夠的對比基礎去判斷:哪些創意真的能驅動高品質點擊,哪些只是剛好出現。
但現在,AI 把這個多樣性慢慢抹平了。當大量廣告主使用相同的基礎模型、相似的 prompt,廣告庫存中的語言特徵分布正在急遽收窄。我稱這個現象為廣告語言特徵的「熱寂」──物理學裡,熱寂是指宇宙的熵趨於最大,所有能量均勻分布,再也沒有任何有用的能量流動。廣告生態系也一樣:當所有文案都收斂到同一個語言平均值,系統中就不再有任何「有用的創意訊號」可以驅動學習。
演算法同質化螺旋:模型失去判別力的連鎖反應
這是我認為最關鍵、也最少人意識到的一環。廣告平臺的排序模型需要「對比」來學習。當它看到大量相似度極高的廣告文案,點擊與轉換訊號會開始出現「特徵稀釋」:模型很難判斷一個點擊是因為文案本身好,還是只是因為使用者剛好看到。於是模型的預測會趨向保守,它不再敢給某個文案特別高的點擊率預估,因為在特徵空間中,這個文案與其他表現平庸的文案太像了。
接下來的連鎖反應大概是這樣:
- 真正有差異化的廣告文案,反而更難被系統「識別」為高潛力素材。
- 系統傾向把大量相似文案放在同一個「平均表現區間」。
- 廣告主發現 AI 文案表現平庸,於是更依賴 AI 進行「優化」──但這種優化通常只是生成更多同類型的語言變體。
- 同質化進一步加劇,模型判別力進一步下降。
這就是所謂的「演算法同質化螺旋」。它不是一夜之間發生,而是逐月、逐季地侵蝕廣告帳戶的邊際效率。很多美國廣告主把 CPC 上升歸因於「競爭變激烈」或「經濟環境變化」,但實際上有一部分是我們自己集體造成的:我們用 AI 把創意多樣性消滅了,然後在競價系統中為這個消失的多樣性付出隱性成本。
你正在為「創意雜訊地板」付費
當排序模型判別力下降,它會用另一種方式維持系統穩定:提高對「不確定性」的定價。簡單說,當系統無法有效判斷你的廣告文案是否比競爭對手更好,它會傾向要求更高的出價來換取相同的曝光位置。
這個現象會反映在幾個具體指標上:
- 相同預算下的有效曝光下降,尤其在中低競爭的關鍵字上更明顯。
- 品質分數(Quality Score)中「預期點擊率」與「廣告關聯性」的評估趨於扁平化。過去差異化強的文案可以拿到 9 分、10 分,現在大家的預期點擊率都被壓在平均區間,因為模型的信心度不足。
- A/B 測試愈來愈難達到統計顯著,因為系統給出的曝光分配缺乏足夠的創意差異訊號。你以為你在測試兩個版本的文案,但在模型眼中它們是同一個版本。
- CPC 與 CPM 出現無法用市場競爭