世界太吵,来原声听播客

Signals and Threads

模型越强,脏数据越致命:清洗反而更值钱

Jane Street 另类数据团队发现:数据一旦把未来信息漏进过去,越强的模型越危险;把「当时知道什么」钉死,比调模型更值钱。

另类数据数据工程量化交易Jane Street数据质量成本模型
这集高密度讲数据工程怎么真正产生价值,后半段关于修正数据、时间戳和成本模型的机制,是多数 AI 讨论里听不到的判断。

核心论点 · 点时间戳可跳到原声

2:06

规律被发现后就会被竞争掉

这是 Eric 定义的 anti-inductive environment:在交易里,你发现的模式往往很快被其他人和市场消化,然后不再有效;能当成物理定律长期积累的知识很少。也因为如此,交易数据的信噪比天然很难看——整个市场的机制就是不断把可提取的信号榨干,剩下的越来越接近随机游走。想持续赢,就要不断找新事实,而不是守着旧规律。

— Eric
19:21

价格可以为负,别把假设写死在系统里

2020年4月20日,CME 上临近到期的原油期货结算价收在负值——就这么一天,最终结算价后来恢复为正。原因不是油没价值,而是交割地 Cushing 的储存空间几乎满了,没人愿意接实物。长期假设价格必为正的下单和风控系统会当场失灵:有人无法下单,有人不知怎么处理负数回报。Eric 的结论是,交易的一大部分是理解现实的笨细节:库容、合约乘数、报价单位,系统把这些细节弄对,风险上限才画得住。

— Eric
32:33

领域专家不知道好工具能多好

数据与系统要真正好用,瓶颈常不在写代码,而在翻译。Eric 观察,交易员对难用流程的忍受力很高,已经被 Excel 和手工流程磨到不知道自己值得更好的工具;反过来,软件工程师若不理解交易领域,也只能按一份窄 spec 做东西。所以他的工作是把领域的真实机制讲给工程师,把「能好到什么程度」讲给交易员。Jane Street 现在每个 desk 都配了这样的 embedded developer,这个角色最初就是这么长出来的。

— Eric
59:04

停车位数量不等于销售额

另类数据的经典例子是数 Walmart 停车场里的车,车上人越多代表生意越好。Eric 说这个例子其实很糟:你要推断的是消费额,车位只告诉你客流量,间接得很;Walmart 约 20% 的购物发生在线上,纽约这种城市也没停车场可数。更直接的信号在交易侧:发卡银行、Visa/Mastercard 网络、信用合作社的处理系统知道人们实际花了多少钱,可以把匿名的聚合统计卖给买方。

— Eric
1:04:08

修正后的数据会让回测变成时间机器

做「要不要订阅这份数据」的决策时,供应商可能已经把过去的错误修正了;拿修正后的漂亮数据回测,测的不是你当年真实会收到的数据,而是后来才知道的正确答案。Eric 说这就等于在模拟自己有一台时间机器。Jane Street 的解法是保存每一份原始数据和收到的本地时间戳,之后无论做多少转换,都能重建「那一刻我们到底知道什么」。这跟怀疑交易所时间戳、只信自己数据抵达时间是一样的逻辑。

— Eric
1:08:10

LLM 知道未来,碰不得历史数据

AI 对另类数据有两层冲击:更强的预测模型提高了好数据的价值,LLM 也让从文本里提特征变得容易。但要小心一个因果陷阱——拿最新的 LLM 去给旧文档做 featurize,它会把后来发生的事带进去:它知道 Enron 最后的下场,也可能在训练数据里见过这份财务报告的后续修订版。这等于制造了新的未来信息泄露,处理历史数据时尤其要钉死「用哪个时点的模型」。

— Eric
1:11:26

模型越强,数据清洗越值钱

一个常见的期待是:神经网络越来越强,特征工程和人工清洗会被取代。Eric 的看法相反:模型自己能做更多事后,手工特征可以少做,但送进去的数据必须更对。如果数据没有做到 point-in-time,把未来的信息悄悄漏进过去,更强的模型会把这种问题学进去;不同模型对离群点和脏数据斑块的承受力也不一样。算下来,清洗数据的价值更高而不是更低。

— Eric
1:16:34

按量计费会诱导团队反复省钱

Jane Street 把数据仓库做在自己机房,不纯是控制欲。Eric 的观察是:把同样的查询搬到云厂商按读取量或计算时长计价,价格高到你会觉得「这些钱够买一堆硬件了」。更重要的是成本模型的扭曲作用——按量计费会让团队不停优化账单、把工作负载改造成迁就计费的样子;自建之后,成本变成一次性硬件投入,团队把时间花在研究和查询本身,而不是省钱。

— Eric

原话 · 已逐字校验

the patterns that you find often get discovered and competed away over time

你找到的那些规律,往往会在被发现之后,随竞争逐渐消失。

Eric2:06

the domain experts like who are not themselves software engineers like don't understand how good things can be if we build the right software for it.

那些不是软件工程师的领域专家,真的不知道——只要我们把软件做对了,事情能好到什么程度。

Eric32:33

Like the thing you're getting at is like how many people showed up which is different from how much they're spending.

你真正想衡量的是来了多少人,而这和人们花了多少钱是两回事。

Eric59:04

you're not actually studying like what trades you would have done if you'd been subscribing to the data set. You're uh simulating what you would have done if you had a time machine, right?

你实际上不是在研究订阅了这个数据之后你能做的交易,而是在模拟你有一台时间机器时会做的事。

if you use like a really up-to-date LLM to like that knows stuff about old data and trying to, you know, use it to featurize some old data, like you're going to get very confusing things happen because the LLM is smart. It knows things about the future.

如果你用一个非常新的、还认识这些旧数据的 LLM,去给旧数据做特征提取,你会得到非常混乱的结果,因为这个 LLM 很聪明——它知道未来发生的事。

It seems like an enormous amount of like human judgment is incredibly important.

看起来,极其大量的判断力仍然无比重要。

数字与实体

Jane Street 数据工程师数量2023 年才有第一位,如今约 20 多位43:42
Walmart 线上购物占比约 20%59:04
原油期货负结算事件2020 年 4 月 20 日一天收在负值,最终结算价转正19:21
数据工程师实习生培养周期2026 面试、2027 暑期、2028 入职、2029 完整出活1:22:40
desk dev 覆盖率Jane Street 每个 desk 都有嵌入式开发23:25

术语

alt data另类数据
用于投资判断、但并非交易所行情等传统数据的外部数据,如卫星图和消费聚合。
anti-inductive environment反归纳环境
规律被发现后会被竞争磨掉,知识难以长期积累的环境。
point-in-time data时点数据
只记录「当时已经知道什么」、不含未来信息的数据。
desk dev交易台嵌入式开发
嵌入交易台、兼顾领域理解与系统开发的工程师。

收听指南

谁该听

想建数据团队的 CTO、在评估数据供应商的量化从业者,以及相信大模型会自动清洗数据的工程师。

可跳过

纯技术背景可跳至 33 分钟后的数据工程,但 19 分钟负油价别错过。