世界太吵,來原聲聽播客

Signals and Threads

模型越強,髒數據越致命:清洗反而更值錢

Jane Street 另類數據團隊發現:數據一旦把未來信息漏進過去,越強的模型越危險;把「當時知道什麼」釘死,比調模型更值錢。

另類數據數據工程量化交易Jane Street數據質量成本模型
這集高密度講數據工程怎麼真正產生價值,後半段關於修正數據、時間戳和成本模型的機制,是多數 AI 討論裡聽不到的判斷。

核心論點 · 點時間戳可跳到原聲

2:06

規律被發現後就會被競爭掉

這是 Eric 定義的 anti-inductive environment:在交易裡,你發現的模式往往很快被其他人和市場消化,然後不再有效;能當成物理定律長期積累的知識很少。也因為如此,交易數據的信噪比天然很難看——整個市場的機制就是不斷把可提取的信號榨乾,剩下的越來越接近隨機遊走。想持續贏,就要不斷找新事實,而不是守著舊規律。

— Eric
19:21

價格可以為負,別把假設寫死在系統裡

2020年4月20日,CME 上臨近到期的原油期貨結算價收在負值——就這麼一天,最終結算價後來恢復為正。原因不是油沒價值,而是交割地 Cushing 的儲存空間幾乎滿了,沒人願意接實物。長期假設價格必為正的下單和風控系統會當場失靈:有人無法下單,有人不知怎麼處理負數回報。Eric 的結論是,交易的一大部分是理解現實的笨細節:庫容、合約乘數、報價單位,系統把這些細節弄對,風險上限才畫得住。

— Eric
32:33

領域專家不知道好工具能多好

數據與系統要真正好用,瓶頸常不在寫代碼,而在翻譯。Eric 觀察,交易員對難用流程的忍受力很高,已經被 Excel 和手工流程磨到不知道自己值得更好的工具;反過來,軟件工程師若不理解交易領域,也只能按一份窄 spec 做東西。所以他的工作是把領域的真實機制講給工程師,把「能好到什麼程度」講給交易員。Jane Street 現在每個 desk 都配了這樣的 embedded developer,這個角色最初就是這麼長出來的。

— Eric
59:04

停車位數量不等於銷售額

另類數據的經典例子是數 Walmart 停車場裡的車,車上人越多代表生意越好。Eric 說這個例子其實很糟:你要推斷的是消費額,車位只告訴你客流量,間接得很;Walmart 約 20% 的購物發生在線上,紐約這種城市也沒停車場可數。更直接的信號在交易側:發卡銀行、Visa/Mastercard 網絡、信用合作社的處理系統知道人們實際花了多少錢,可以把匿名的聚合統計賣給買方。

— Eric
1:04:08

修正後的數據會讓回測變成時間機器

做「要不要訂閱這份數據」的決策時,供應商可能已經把過去的錯誤修正了;拿修正後的漂亮數據回測,測的不是你當年真實會收到的數據,而是後來才知道的正確答案。Eric 說這就等於在模擬自己有一臺時間機器。Jane Street 的解法是保存每一份原始數據和收到的本地時間戳,之後無論做多少轉換,都能重建「那一刻我們到底知道什麼」。這跟懷疑交易所時間戳、只信自己數據抵達時間是一樣的邏輯。

— Eric
1:08:10

LLM 知道未來,碰不得歷史數據

AI 對另類數據有兩層衝擊:更強的預測模型提高了好數據的價值,LLM 也讓從文本里提特徵變得容易。但要小心一個因果陷阱——拿最新的 LLM 去給舊文檔做 featurize,它會把後來發生的事帶進去:它知道 Enron 最後的下場,也可能在訓練數據裡見過這份財務報告的後續修訂版。這等於製造了新的未來信息洩露,處理歷史數據時尤其要釘死「用哪個時點的模型」。

— Eric
1:11:26

模型越強,數據清洗越值錢

一個常見的期待是:神經網絡越來越強,特徵工程和人工清洗會被取代。Eric 的看法相反:模型自己能做更多事後,手工特徵可以少做,但送進去的數據必須更對。如果數據沒有做到 point-in-time,把未來的信息悄悄漏進過去,更強的模型會把這種問題學進去;不同模型對離群點和髒數據斑塊的承受力也不一樣。算下來,清洗數據的價值更高而不是更低。

— Eric
1:16:34

按量計費會誘導團隊反覆省錢

Jane Street 把數據倉庫做在自己機房,不純是控制慾。Eric 的觀察是:把同樣的查詢搬到雲廠商按讀取量或計算時長計價,價格高到你會覺得「這些錢夠買一堆硬件了」。更重要的是成本模型的扭曲作用——按量計費會讓團隊不停優化賬單、把工作負載改造成遷就計費的樣子;自建之後,成本變成一次性硬件投入,團隊把時間花在研究和查詢本身,而不是省錢。

— Eric

原話 · 已逐字校驗

the patterns that you find often get discovered and competed away over time

你找到的那些規律,往往會在被發現之後,隨競爭逐漸消失。

Eric2:06

the domain experts like who are not themselves software engineers like don't understand how good things can be if we build the right software for it.

那些不是軟件工程師的領域專家,真的不知道——只要我們把軟件做對了,事情能好到什麼程度。

Eric32:33

Like the thing you're getting at is like how many people showed up which is different from how much they're spending.

你真正想衡量的是來了多少人,而這和人們花了多少錢是兩回事。

Eric59:04

you're not actually studying like what trades you would have done if you'd been subscribing to the data set. You're uh simulating what you would have done if you had a time machine, right?

你實際上不是在研究訂閱了這個數據之後你能做的交易,而是在模擬你有一臺時間機器時會做的事。

if you use like a really up-to-date LLM to like that knows stuff about old data and trying to, you know, use it to featurize some old data, like you're going to get very confusing things happen because the LLM is smart. It knows things about the future.

如果你用一個非常新的、還認識這些舊數據的 LLM,去給舊數據做特徵提取,你會得到非常混亂的結果,因為這個 LLM 很聰明——它知道未來發生的事。

It seems like an enormous amount of like human judgment is incredibly important.

看起來,極其大量的判斷力仍然無比重要。

數字與實體

Jane Street 數據工程師數量2023 年才有第一位,如今約 20 多位43:42
Walmart 線上購物佔比約 20%59:04
原油期貨負結算事件2020 年 4 月 20 日一天收在負值,最終結算價轉正19:21
數據工程師實習生培養週期2026 面試、2027 暑期、2028 入職、2029 完整出活1:22:40
desk dev 覆蓋率Jane Street 每個 desk 都有嵌入式開發23:25

術語

alt data另類數據
用於投資判斷、但並非交易所行情等傳統數據的外部數據,如衛星圖和消費聚合。
anti-inductive environment反歸納環境
規律被發現後會被競爭磨掉,知識難以長期積累的環境。
point-in-time data時點數據
只記錄「當時已經知道什麼」、不含未來信息的數據。
desk dev交易臺嵌入式開發
嵌入交易臺、兼顧領域理解與系統開發的工程師。

收聽指南

誰該聽

想建數據團隊的 CTO、在評估數據供應商的量化從業者,以及相信大模型會自動清洗數據的工程師。

可跳過

純技術背景可跳至 33 分鐘後的數據工程,但 19 分鐘負油價別錯過。