新聞

跨國廣告科技業者Taboola專攻廣告投放,每天觸及6億多名使用者。但每則廣告正式投放前,都得先經過內容審查。可是廣告量、語言和投放市場不斷增加,人工審查越來越跟不上,遇到灰色地帶時不只判斷不一致,傳統機器學習(ML)方法也難以因應多模態廣告審查需求。

為解決這些痛點,Taboola資料科學團隊採用Harness工程,以5層架構打造出大型語言模型(LLM)廣告審查系統Argus。該系統上線後,不只能審查所有英文廣告,還將原本人工審查的12小時縮短至數分鐘、減少人工審查員75%的工作量;審查一致性也比人工高出13個百分點。「模型是引擎,Harness才是整輛車,」Taboola內容品質資料科學團隊主管Eagle Chen強調。

人工審查耗時又不一致,傳統ML也難以擴展

Eagle Chen解釋,廣告審查雖然可以簡化為分類問題,也就是通過與否。但其實,廣告審核涉及多種模態和元素,比如文字、圖片、連結、投放市場和當地法規等。

以減肥廣告為例,該廣告可能包含前後對比照片、寫著「FDA核准」和宣稱效果等文字,也可能包含網站連結。這時,廣告審查員就得判斷內容是否誇大、查證「FDA核准」是否屬實,以及圖片是否涉及名人肖像、是否為真,還有連結點擊後會導向哪個網站等。

但人工審查有著3大痛點,首先,不同審查員對灰色地帶的判斷可能不同,甚至同一人在不同時間,也可能給出不同答案。再來,廣告主有時要等超過一天才能知道結果,這些等待時間無形中損失了自身利益。最後,不同語言和市場需要不同背景知識,政策每次更新,Taboola就得重新訓練審查人員。

Taboola曾用傳統機器學習方法,來解決廣告審查的挑戰。由於一支廣告包含多種模態,團隊得維護好幾套模型,來分別處理文字、影像、語言、廣告類型、地區規則等不同類別的內容判斷,久而久之形成龐大的Model Zoo。

再加上審查員的人工標註資料不一致,Taboola沒有乾淨的資料來訓練ML模型。而且,廣告審查政策時常變動,Taboola得花功夫反覆重新訓練模型。這就造成,Model Zoo的模型最後只能審查少部分廣告,難以因應大量廣告審查。

看好LLM,用Harness工程打造廣告審查系統Argus

後來,LLM興起,Taboola決定用來解決廣告審查痛點。

這是因為,LLM同一支模型,就可以同時理解文字和圖片等多種模態,也能依需求呼叫工具、動態載入額外背景資訊,團隊不必再為不同任務,各自建立模型。

再來,Taboola不一定要先微調模型。就算人工標註資料不夠乾淨,團隊還是可以透過指令(Prompt),要求LLM按照Taboola內容政策進行判斷。當政策變更時,內容政策人員可以直接更新規則和指令,不必等工程團隊重新訓練模型。

看上這些好處,Taboola團隊決定用Harness工程方法,來打造這套LLM廣告審查系統Argus。Eagle Chen形容,LLM就像是引擎,Harness是整輛車,是圍繞LLM展開的一切工程架構。在這個概念下,他們將Argus拆分為5大層,包括控制流程(Control Flow)層、上下文層、工具層、記憶層和CI/CD自動化流程層。

參考人工審查分9大階段,還採動態組合式指令

首先,在控制流程層,Taboola希望Argus能像人類一樣審查廣告,因此他們對照既有的人工審查流程,為Argus設計一套相對應的9大階段審查流程。

舉例來說,人工審核第一步是判斷廣告類型和領域,Argus在第一階段(Master)也是先判斷廣告類型、內容領域和適用政策,接著才檢查帳號紀錄、第三階段查證廣告宣稱,再分別審查廣告內容和點擊連結後的登錄頁面(Landing page),最後決定是否通過審查,並產生說明。

Eagle Chen強調,這9大階段的每個階段,都會留下紀錄,也能獨立測試、稽核和更換各自的模型,要是出問題,團隊也能追蹤。

有了控制流程層,接著是Argus的上下文層。這層專門處理Argus接收的指令,這些指令並非寫死,而是根據第一層產出的Master標註,動態組合出每支廣告的專屬指令。

也就是說,第一層Argus分析廣告類型、內容領域、適用政策和投放市場後,系統會根據各自的標註,從既有的政策資料庫中,挑出真正相關的規則,組成這支廣告專用的指令。這種做法不只更省Token,還能減少無關規則的干擾,提高判斷準確度。

再來,在第三層的工具層,Argus可以調用工具來查證廣告宣稱的內容,比如減肥藥產品宣稱獲得FDA核准、名人代言或臨床數據等,Argus可以呼叫網頁和圖片搜尋工具來確認真偽。

Eagle Chen強調,Argus所使用的工具,都是Taboola自行打造,避免被特定LLM廠商捆綁,也保留換模型的彈性。

到了第四層的記憶層,Taboola希望Argus不只是照政策內容審查廣告,也要會參考過去的審查經驗。所以,他們建立一個簡單的RAG流程,先讓系統擷取待審查的廣告圖片和文字向量,再從歷史資料中找出類似的通過和拒絕案例,放進指令、作為Few-shot範例。

這就像是每次審查時,把Taboola累積的經驗也交給模型,供模型參考、判斷。尤其遇到灰色地帶時,類似案例可以當做判斷基準,降低LLM這次過於寬鬆、下次又過度嚴格的情況,維持一致性。

指令也是程式碼,也要走CI/CD

Argus的Harness工程架構最後一層是CI/CD層,也就是用來評估、維護Argus這套系統的機制。

CI/CD層包含2大核心概念,首先是把指令當作程式碼,意思是,指令也要有版本控制,也要經過測試。無論是修改指令、調整流程,還是更換底層模型,都必須經過一系列評測;尤其是控制流程層的9個階段,每個階段都得進行回歸測試,通過Release Gate才能上線。

這個Release Gate主要檢查3件事:品質、成本和延遲。Eagle Chen特別強調後兩者,因為,指令可能因某次調整而提高整體準確率,但Token使用量卻暴增,導致模型費用和處理時間跟著增加,無法在時間內完成廣告審查。

對Taboola來說,CI/CD層還有另一大意義,也就是不再只由工程師負責,而是由內容政策專家主導。他們可以在測試庫中,自行修改指令和政策,調到滿意後再進行一系列評測,必要時也能在Taboola提供的標註平臺,自行建立新的標註資料。

同時,Taboola也導入一款LLM-as-a-Judge,讓專家不必標註完所有資料,就能先判斷更動可能帶來的影響,節省標註時間。

Harness工程的好處:可以邊開車邊換引擎

Eagle Chen還分享這套Harness工程設計的好處。就在今年2月,Argus原本使用GPT-4o模型,但當時已有不少新模型問世,於是,Taboola用自己的評測流程來測試OpenAI、Google和其他開源模型,最後決定換成Gemini 3 Flash。

換模型後,首月成本雖然降低30%,但領域專家發現,模型在兩個IAB廣告分類時出現過度拒絕的現象。

為解決這個問題,團隊將處理IAB分類的模型,改回原本的舊模型,其他階段則繼續使用新模型。接著,他們再請內容政策專家調整規則和指令,重新測試後再上線新模型。

Eagle Chen形容,這種換模型作業,就像在F1比賽中替賽車換輪胎。模型更換原本是高風險的更動,但透過Harness架構和CI/CD設計,也能變成可監控、可回退的例行流程。

Argus上線後,廣告審查的平均時間不只從12小時縮短到幾分鐘、能處理所有英文廣告,還減少人工審查員75%的工作量。甚至,審查一致性也提高了13個百分點。

Taboola還發現一項意料外的效果。Argus審查廣告不通過時,不只會指出哪裡違反政策,還會給出詳細的修改建議給廣告主。Taboola統計發現,與人工審查相比,被Argus拒絕的廣告,重新修改送審的比例高出一倍;最終修改後通過的比例,也提高至1.5倍。

從Harness工程學到的3件事

打造Argus的過程,也讓Taboola學到不少寶貴經驗。

Eagle Chen指出,首先,企業可直接參考現有的人工作業流程,來設計LLM系統。這麼做,AI的每個判斷步驟更透明,也更容易追蹤,業務使用者也更願意信任這套系統。

第二,Harness架構不該只由工程團隊決定,還要交給領域專家驅動。以Taboola為例,部分資深審查員如今轉為AI導師,負責教Argus如何理解政策、判斷廣告內容。他們的工作,從親自審查每則廣告,轉為協助調整和改善AI系統。

最後則是CI/CD的設計,因為它是LLM系統持續迭代和運作的關鍵。無論是修改指令、調整流程,還是更換模型,都要先經過版本控制和測試,確認品質、成本與處理速度沒有問題,才能正式上線。這也是Argus能持續更新,又不至於因為一次改動就影響整套系統的關鍵。