SellingInUS

你的 A/B 測試,可能只是演算法的自證預言

做了那麼多年的美國數位行銷,我發現一個很少被拿出來談的問題:多數人把 A/B 測試廣告創意當成中立的裁判,好像只要讓兩個素材打一架,贏的那個就是消費者真心喜歡。但在 Google Ads 和 Meta Ads 這種以機器學習為核心的平台上,你的測試結果很可能在統計顯著性出現之前,就已經被演算法的流量分配邏輯污染了。

這不是說 A/B 測試沒用,而是我們對它的預設根本錯了。以下我想從自己實際操盤的經驗,拆解這個隱形偏誤的成因,並給出一套在美國市場真正可行的測試框架。

課本上的隨機分派,在廣告平台根本不成立

傳統 A/B test 的假設很清楚:隨機分派、樣本獨立、其他條件不變。你在電子報發兩種標題,名單隨機切成兩半,這兩半的人不會互相影響,最後看開信率,誰高誰贏。這套邏輯放在電子報、甚至放在網頁登陸頁測試都還說得過去。

但廣告平台不是被動的曝光管道。Meta 和 Google 的系統會在你按下啟動的那一刻開始「學習」。它們根據早期的互動訊號--可能是點擊率、觀看時間、下滑速度、轉換意圖--動態調整流量。這代表一個很可怕的事:早期些微的隨機差異,會被演算法放大成系統性的曝光優勢。

舉一個我親眼看過的例子。某個美國電商客戶同時上兩個影音素材,創意 A 在前兩個小時恰好被推送給一群半夜滑手機、購買意圖本來就高的人;創意 B 卻先被丟給一群剛好滑過去、根本不想互動的人。A 的初期點擊率稍微高一點,Meta 的學習系統立刻判定 A 比較好,接著把後面 80% 的預算都灌給 A。最後報表跑出來,A 顯著勝出。但真正發生的事,不是消費者比較喜歡 A,而是演算法對初期雜訊做了一次「信心投票」,然後用流量把這個假象坐實。

這種狀況在美國市場尤其常見,因為競爭激烈、受眾池子大,廣告系統有非常多的訊號可以拿來合理化自己的分配決策。你以為你在做實驗,其實你在看演算法表演它最擅長的事:把一個小偏差餵成一個大結論。

自動化廣告讓問題更難看見

過去幾年,美國市場的預算主力已經明顯移向 Google Performance Max 和 Meta Advantage+。這些產品的好處是省時間,但代價是測試的「變因隔離」幾乎瓦解。

Performance Max 會自動幫你組合素材、挑版位、找受眾,甚至自動生成短版影片。你以為你上傳了三個圖片在測哪個好,實際上系統可能把第一個圖片拿去搜尋聯播網、第二個拿去 YouTube Shorts、第三個丟進 Gmail,然後各自搭配不同的受眾訊號和出價策略。你的「A 對 B」根本不是同一個賽道上的比較,而是三個不同情境下、被不同演算法邏輯包裝過的綜合結果。這種狀態下得到的勝負,有多大參考價值?老實說,很低。

更麻煩的是 iOS ATT 之後,訊號損失讓平台更依賴「創意互動」當代理指標。Meta 幾乎明示廣告主,創意不再只是跟人溝通,而是餵給機器學習的燃料。在這種邏輯下,演算法會偏好那些能快速引起點擊、觀看或互動的素材。問題是,快速引起互動的創意,跟能建立長期品牌記憶、帶來高品質轉換的創意,往往是兩回事。

我看過太多品牌陷入一個循環:看到點擊率高就加碼,後來發現來的都是便宜但沒購買力的流量;或者用兩天的數據決定創意方向,結果創意策略被雜訊牽著走,越改越糟。更常見的,是只看平台報表上的 ROAS,卻不做增量測試,無法分辨那些轉換是真的新增,還是只是從其他管道移轉過來、被平台歸因搶了功勞。

別把「演算法偏好」當成「消費者偏好」

這是我認為最關鍵的一句話。行銷人每天看後台,很容易把報表上的數字直接翻譯成消費者行為。但報表反映的,是演算法在那個時間點、那個競價環境下做的選擇,不是消費者內心深處的偏好。

我舉一個實際的感受。有個做家居用品的美國品牌,測了兩個靜態圖:一個是乾淨的產品白底圖,一個是生活情境圖。後台顯示情境圖的 CTR 高出三成,客戶很開心,認為消費者愛情境。但當我們進一步看受眾品質,發現情境圖吸引來的大量點擊來自「興趣相似但購買力低」的族群,白底圖的點擊少,但進站後加入購物車的比例高出一倍。如果我們只信 CTR,就會把預算全部押在情境圖,最後訂單反而掉。

這種例子不勝枚舉。演算法喜歡的,不一定是你需要的。

專家的解決框架:三階段創意測試法

那怎麼辦?我的做法是把創意測試分成三個階段,分別處理不同的問題。這套方法在美國市場的電商、SaaS、本地服務都適用,核心精神是:不要把平台的單次測試結果當作最終判決,而是把它當成一個初步訊號,再用其他方法驗證。

第一階段:隔離測試,找出相對穩定的訊號

先用 Meta Experiments 的 Creative Test 或 Google Ads Experiments,強制設定相同預算、相同最佳化目標、相同版位。然後根據預期轉換率,算好需要多少樣本量才跑得到「夠穩」的數據。這一步的重點不是追求完美的隨機分派,因為你知道平台還是會有學習偏誤。重點是觀察哪些創意在「相對公平」的條件下,能持續給出不錯的訊號。

我會特別記錄以下幾個數字:

  • CTR 或 Thumbstop Ratio(對影音素材而言,三秒觀看率比總觀看率更重要)
  • 進站後的行為,例如加入購物車率、跳出率、頁面停留時間
  • 轉換事件的「品質」,例如客單價、回購率、客服退貨率

不要只看平台給的 ROAS。平台報表擅長告訴你「誰在歸因裡贏了」,但不太擅長告訴你「誰真的帶來好生意」。

第二階段:增量驗證,拆穿歸因的假象

把第一階段表現較好的創意,放進地理區域對照測試(Geo Lift)或品牌提升研究。最簡單的作法,是在美國選定數個 DMA 市場,一組投放新創意,另一組維持舊創意,觀察真實的增量轉換與品牌搜尋量變化。

為什麼要這樣做?因為平台歸因很容易把「本來就會買的人」算成「因為這個廣告才買的人」。Geo Lift 能幫助你判斷這個創意是否真的帶來額外價值,而不只是重新分配功勞。這個做法的成本不低,但比起幾十萬美金廣告費砸下去才發現歸因膨脹,這筆錢非常值得。

第三階段:品牌記憶與疲勞監測

廣告創意不只為了轉換,也承載品牌記憶結構。美國市場的研究一再顯示,短期高互動的創意可能很快就疲勞,而且對品牌資產的貢獻低得可憐。我常常跟客戶說,如果你用一個很聳動的素材衝出高 CTR,但三個月後消費者完全不記得你的品牌,那這個測試的「勝出」沒有意義。

這個階段要看的指標包括:

  • 品牌關鍵字搜尋量,有沒有因為新創意增加?
  • 直接流量是否上升?
  • 廣告回想度調查的分數變化
  • 創意疲勞曲線:同樣素材跑了多久之後 CTR 開始明顯下滑?

把這些長期指標納入決策,你才不會被演算法的短期偏好綁架。

最後的提醒

在自動化與隱私限制並存的美國數位行銷市場,A/B 測試廣告創意的真正挑戰,早就不是「如何做出統計顯著性」,而是「如何判斷你的顯著性是來自消費者,還是來自演算法的自證預言」。這兩者的界線非常模糊,但如果你能看穿這一層,就不會把大筆預算花在餵養平台的機器學習,而是真正建立品牌與消費者的連結。

下次你看著後台說「這個創意贏了」之前,先問自己一句:贏的是創意,還是演算法?

← 返回部落格