EN
English
简体中文
Log inGet started for free

Blog

Scraper

文字很便宜,影片才是金礦:多模態團隊為何正在

文字很便宜,影片才是金礦:多模態團隊為何正在重造資料供應鏈

快速結論: 過去兩年,每個多模態 AI 團隊都撞上同一堵牆。文字資料充足且被充分理解;而下一世代模型的原料——影片資料——稀缺、蒐集成本高昂、授權地雷遍布,且難以大規模去重。現成的影片資料集正成為解答,而它的經濟學與文字資料的世界截然不同。

2024 年的某個時刻,AI 實驗室內部的共識悄悄變了:文字,大家都夠用了。瓶頸轉移了。

沒人編列預算的多模態資料難題

訓練一個理解影片的模型,不是「把理解文字的模型放大」這麼簡單。差異是結構性的,而且每一條都是一筆預算:

影片無法免壓縮成 token。 一小時的影片是數千個影格、一條音軌,外加一份可能不存在的字幕。以這種形狀儲存、轉碼與串流訓練資料,需要文字優先團隊根本沒有的基礎設施。一 TB 的文字是零頭;一 TB 的影片是一個下午的上傳量。

開放網路是充滿敵意的資料來源。 影音平台封鎖批次存取、限縮 API 配額,並主動偵測大規模採集。天真地自建爬蟲的團隊會發現,影片管線的工程成本——代理輪替、轉碼、詮釋資料擷取、去重——與訓練本身不相上下。

授權是地雷區。 「我們在網路上找到的」不是資料來源策略。訓練商業模型的團隊必須回答每一片訓練資料從哪裡來,而土法煉鋼的爬取沒有任何好答案。

去重本身就是一道研究難題。 同一支影片會以重新編碼、裁切、加浮水印、跨平台重傳的形式反覆出現。在十億級規模上做近似重複影片偵測是獨立的工程學門——而重複的資料會默默降低訓練品質,同時墊高儲存成本。

結果是一個熟悉的模式:多模態專案不是卡在建模階段,而是卡在資料階段,一卡就是兩三個季度。

一個為訓練而生的影片資料集,實際上長什麼樣

這是多數團隊很晚才發現的事:一份嚴肅的影片資料集不是「一個裝滿 MP4 的資料夾」。它是一個結構化、可查詢的資產。Thordata 的影片資料集——明確為 LLM 與多模態模型訓練而建——展示了這個類別在規模上的樣貌:

屬性規模
原始影片數60 億支
獨立來源頻道數7 億個
定位LLM 與多模態模型訓練
交付方式結構化紀錄,支援雲端/物件儲存交付
計費模式資料集紀錄每 1,000 筆約 $0.25 起

想想 7 億個獨立頻道在實務上意味著什麼:橫跨語言、地區、內容利基與製作風格的涵蓋面,任何單一平台的爬取都組不出來。對訓練多語言或跨文化多模態模型的團隊而言,頻道多樣性往往比原始影片數量更有價值——它是「只懂一種內容文化的模型」與「能夠泛化的模型」之間的差別。

除了影片之外,Thordata 更廣的資料集目錄以同樣的按筆計費模式涵蓋 100 多個網域,需求不符合現成規格的團隊也可以洽談客製資料集。

自建、購買,還是混合:決策框架

多模態團隊在評估資料策略時,誠實版的決策長這樣:

策略前期成本首次訓練所需時間來源可追溯性適合對象
完全自建採集工程成本高、單位成本低2 至 4 個季度除非大量投入,否則薄弱有常設資料平台編制的團隊
採購現成資料集低,按筆計費數週供應商已把關追求快速迭代、需要領域多樣性的訓練
兩者混合中等數週跑首次、數季建護城河混合多數認真的團隊

訓練團隊之間已經浮現的模式是「混合」:先買現成資料集,讓第一、第二次訓練立刻動起來;同時針對自家產品真正差異化的窄領域,平行建立專屬採集能力。現成資料降低時程風險;專屬資料建立護城河。

至於混合策略中「自建」的那一半,基礎設施同樣關鍵:大規模採集影片與詮釋資料需要具備地理定位能力的住宅與行動代理——Thordata 的網路擁有超過 1 億個住宅 IP、覆蓋 190 多個國家,行動 IP 規模在 60 萬等級,專門對付對資料中心流量最不友善的平台。而對於產品也需要理解自家內容排名的多模態團隊——隨著生成式影片產品開始爭奪搜尋能見度,這個需求越來越常見——同一家供應商的 SERP 監控解決方案能把資料供應鏈延伸到結構化的搜尋結果。

資料集整合的內部實況

把現成資料集整合進訓練管線,通常是一場 ETL 工程,而不是研究專案。典型流程:

# 虛擬碼:資料集紀錄 → 訓練樣本準備
for record in dataset.stream(filter={"language": {"$in": ["en", "zh", "es"]}}):
    sample = {
        "video_url": record["video_url"],       # 或雲端儲存路徑
        "duration": record["duration_seconds"],
        "channel_id": record["channel_id"],      # 可回溯至來源
        "captions": record.get("caption_text"),  # 有字幕時提供
        "audio_lang": record.get("audio_language"),
        "license_scope": record["license_scope"],# 授權範圍詮釋資料
    }
    if passes_quality_filters(sample):           # 你的去重 + 品管邏輯
        emit_to_training_shard(sample)

紀錄結構比表面上更重要。頻道層級的來源標記(lineage)同時支援來源稽核與分層抽樣——讓你能以均衡的內容類型組合訓練,而不是照單全收採集過程湊巧過度代表的內容。

常見問答:多模態團隊最先問的問題

現成資料集的資料可以用於商業模型訓練嗎? 有信譽的資料集供應商——包括 Thordata——會把來源追溯與授權範圍內建在資料集結構中,這正是相對於自行採集資料的優勢。訓練之前,務必針對你的特定商業用途確認授權範圍。

如何避免跨採購資料集的重複訓練? 訓練邊界的去重仍是你的責任,但資料集端的頻道與影片識別碼,讓近似重複偵測的成本比處理原始檔案低得多。在品質過濾階段之前,使用內容雜湊加上詮釋資料比對。

可以取得特定領域的子集嗎?例如特定語言的教學型內容? 這正是按紀錄結構計費的意義所在:在你為儲存與訓練運算付費之前,先按語言、時長、頻道屬性與內容詮釋資料過濾。若需求超出既有過濾條件,客製資料集是標準途徑。

相對於訓練運算,資料集到底貴不貴? 以每 1,000 筆紀錄約 $0.25 起的價格計算,資料採購幾乎永遠只占多模態訓練總成本的一小部分——運算與儲存才是大頭。這就是「先買、平行自建」成為標準模式的原因:資料很少是貴的那部分,延誤才是。(附帶一提混合策略的採集側:取得新鮮的 SERP 訓練訊號也同樣被商品化了——SERP 監控解決方案按結構化筆數計費,而非按 HTML 的 GB 計費。)

我們也需要持續的新鮮採集,資料集供應商能做嗎? 同時經營資料集與採集基礎設施的供應商——如 Thordata,具備爬蟲 API、解鎖層與對付最難目標的 Scraping Browser——可以將持續採集作業當成託管服務來執行,按排程餵養你的訓練管線,而非一次性交付。

值得注意的轉變

文字資料時代獎勵爬得最快的團隊。多模態時代獎勵能組裝出最多樣、文件最完善、整合最快的資料供應鏈的團隊——因為現在的邊際模型改進來自資料的廣度與品質,而不是在同一個語料上多跑幾個 epoch。

如果你的多模態路線圖上有個資料形狀的洞,評估現成影片資料集是一週的實驗,不是一季的專案。從影片資料集目錄開始,用你的訓練計畫圈選一個過濾後的子集;而如果產品的成長也取決於搜尋能見度,再看看持續 SERP 監控如何讓你的分銷情報跟訓練資料一樣新鮮。