用神经网络补后牛顿项,比纯数据驱动省一万倍训练量
纯神经网络波形模型要 10 的 8 次方到 10 的 10 次方条训练数据,而把已知物理写进网络、只让它学修正项,8 条数值相对论波形就够了。
核心论点 · 点时间戳可跳到原声
LIGO 的误差棒可能来自理论而非仪器
讲者说,对某些 LIGO 事件,还不能排除分析结果受限于对波形系统误差的理解,而不只是低温冷却或镜面缺陷。GW23123 就是例子:换不同模型跑,后验分布会出现非平凡的差异。他的立场是不站队谁对,而是给模型提供更好的误差棒,让做数据分析的人继续争论谁对。
— Nils Deppe模拟时长翻倍,误差涨四倍
数值相对论模拟的失配大致按波长的平方缩放。因为模拟的精度由相位误差主导,相位误差随时间线性累积,而失配是相位误差的平方。所以想要两倍长的模拟,不只是等更久,还得把精度做得更高,成本是乘法式地惩罚。目前大多数模拟落在约 30 个轨道,而参考线是约 25 个轨道。
— Nils Deppe下一代探测器上,纯数值相对论没有希望
讲者展示了一张图:横轴是事件信噪比,纵轴是目录里精度和长度都够用的模拟数量。对 LIGO,大约 85% 到 90% 的目录够用,约 3000 条模拟;但到 10 的 4 次方信噪比的重系统,总共只有约 10 条模拟够用。对 Cosmic Explorer 和 Einstein Telescope,结论是数值相对论单独完全不够,需要别的模型来补。
— Nils Deppe混合波形其实在拼两个不同的物理系统
把后牛顿波形和数值相对论波形拼接时,代价函数在参数空间里有大量局部极小值,全局极小值落在一个又窄又浅的山谷里,优化器很难找到。测试方法是跑约 60 个轨道的模拟,然后移动匹配窗口,看早期波形长什么样。结果是早期数值相对论波形和后牛顿波形看起来完全不同,等于把两个不同物理系统的波形平滑地缝在一起,引入了偏差。
— Nils Deppe只让神经网络学后牛顿算不出来的那部分
后牛顿项每多算一项就是一篇博士论文的工作量,所以讲者的思路是把神经网络当成编码所有他不想手写的后牛顿项。网络只需要约 100 个参数,训练约 120 CPU 小时,在质量比空间里只需要 8 条数值相对论波形。损失函数除了波形差异,还要求轨道速度接近、修正项在轨道速度趋于零时消失、以及等质量对称性和权重正则化。
— Nils Deppe物理信息网络在训练集外推得更好
在质量比 9 比 5 这个训练集之外的点上,后牛顿在接近并合时完全失效,surrogate 模型(训练到质量比 8)随着外推误差变大,而物理信息神经网络表现好得多。如果在已经训练到质量比 8 之后再加一个质量比 15 的数据点,一直到质量比 15 的误差都会大幅下降。这有望减少构建模型所需的训练数据量。
— Nils Deppe纯神经网络方案需要一万倍以上的训练数据
讲者说,他看到的其他用神经网络建模波形的尝试,大多是完全抛开物理、只用神经网络或自编码器,那样真的需要 10 的 8 次方到 10 的 10 次方条波形来训练,意味着你得先建好 surrogate 才能生成训练数据,因为不可能拿到那么多数值相对论波形。他的结论是:机器学习是有用工具,但别忘了你其实对要建模的东西是知道一些东西的。
— Nils Deppesurrogate 加速 30 到 40 倍,靠的是换算法
讲者说,他做的不过是把代码改得不那么烂,没有革命性的洞见。起点约 30 毫秒,现在约 30 到 40 倍加速。最大的加速来自换算法:从三次插值换成十阶 Hermite 多项式,时间节点少得多。目前动力学部分占了大头,约 370 微秒,波形求值只要 50 微秒。他估计最终能给出 0.2 毫秒的频率域波形,和最快的 phenom 波形相当甚至更好。
— Nils Deppe原话 · 已逐字校验
anything that you agree with you should attribute to them anything that you disagree with you should attribute to me
你同意的任何东西都应该归功于他们,你不同意的任何东西都应该归咎于我。
Nils Deppe1:18
if I want a simulation that's twice as long in time, I will have a total error that's four times larger in a 3D simulation
如果我想要一个时间上两倍长的模拟,在三维模拟中我的总误差会大四倍。
Nils Deppe8:25
you're taking the PN wave from form from one system early on and stitching it to together with a waveform from a different physical system and then you combine them in a smooth way
你是在把早期来自一个系统的后牛顿波形,和来自另一个不同物理系统的波形缝在一起,然后用平滑的方式把它们组合起来。
Nils Deppe23:40
calculating post Newtonian terms is so difficult that like at this stage it's like one extra term is an entire PhD thesis
计算后牛顿项是如此困难,以至于在这个阶段,多算一项就是一整篇博士论文。
Nils Deppe33:50
you should remember that you have physics like machine learning is is is a useful tool but don't forget that you actually maybe know something about the thing you're modeling
你应该记住你是有物理的,机器学习是个有用的工具,但别忘了你其实可能对你要建模的东西是知道一些东西的。
Nils Deppe44:58
I haven't done roughly speaking anything more than like fired a few neurons right like none of this was like I would say revolutionary like insight deep things this is just picking the code and making it not suck
粗略地说,我做的不过是动了几个神经元,这些都不是我会称之为革命性的深刻洞见,这只是把代码捡起来让它不那么烂。
Nils Deppe55:08
I don't think I can give you a surrogate model that's faster than 0.2 two milliseconds for a frequency domain waveform for this kind of a system
我不认为我能给你一个比 0.2 毫秒更快的、针对这类系统的频率域波形 surrogate 模型。
Nils Deppe57:10
数字与实体
| LIGO 目录中够用的模拟比例 | 约 85% 到 90%,约 3000 条 | 17:36 |
| 10 的 4 次方信噪比重系统够用的模拟数量 | 约 10 条 | 16:33 |
| 物理信息神经网络参数量 | 约 100 个 | 33:50 |
| 物理信息神经网络训练所需数值相对论波形数 | 8 条 | 33:50 |
| 物理信息神经网络训练时间 | 约 120 CPU 小时 | 33:50 |
| surrogate 加速倍数 | 约 30 到 40 倍 | 55:08 |
| 波形求值耗时 | 50 微秒 | 54:08 |
| 动力学部分耗时 | 370 微秒 | 55:08 |
| 目标频率域波形耗时 | 0.2 毫秒 | 57:10 |
| 单次 LIGO 事件分析目标时间 | 30 分钟以内 | 1:01:15 |
术语
- surrogate model代理模型
- 用少量数值相对论模拟插值出任意参数下波形的快速模型。
- physics informed neural network物理信息神经网络
- 把已知物理方程写进网络结构,只让网络学修正项。
- post-Newtonian后牛顿
- 引力波早期旋进的近似解析展开,越接近并合越不准。
- mismatch失配
- 衡量两个波形差异的指标,数值相对论中由相位误差主导。
- co-orbital frame共轨道参考系
- 跟着双星旋转的参考系,让波形更平滑、更容易建模。
收听指南
做引力波数据分析、数值相对论或科学机器学习的研究生和工程师,尤其是想用物理约束降低训练数据量的人。
开头约 5 分钟的会议介绍和探测器灵敏度曲线背景可以快进。