用神經網絡補後牛頓項,比純數據驅動省一萬倍訓練量
純神經網絡波形模型要 10 的 8 次方到 10 的 10 次方條訓練數據,而把已知物理寫進網絡、只讓它學修正項,8 條數值相對論波形就夠了。
核心論點 · 點時間戳可跳到原聲
LIGO 的誤差棒可能來自理論而非儀器
講者說,對某些 LIGO 事件,還不能排除分析結果受限於對波形系統誤差的理解,而不只是低溫冷卻或鏡面缺陷。GW23123 就是例子:換不同模型跑,後驗分布會出現非平凡的差異。他的立場是不站隊誰對,而是給模型提供更好的誤差棒,讓做數據分析的人繼續爭論誰對。
— Nils Deppe模擬時長翻倍,誤差漲四倍
數值相對論模擬的失配大致按波長的平方縮放。因為模擬的精度由相位誤差主導,相位誤差隨時間線性累積,而失配是相位誤差的平方。所以想要兩倍長的模擬,不只是等更久,還得把精度做得更高,成本是乘法式地懲罰。目前大多數模擬落在約 30 個軌道,而參考線是約 25 個軌道。
— Nils Deppe下一代探測器上,純數值相對論沒有希望
講者展示了一張圖:橫軸是事件信噪比,縱軸是目錄裡精度和長度都夠用的模擬數量。對 LIGO,大約 85% 到 90% 的目錄夠用,約 3000 條模擬;但到 10 的 4 次方信噪比的重系統,總共只有約 10 條模擬夠用。對 Cosmic Explorer 和 Einstein Telescope,結論是數值相對論單獨完全不夠,需要別的模型來補。
— Nils Deppe混合波形其實在拼兩個不同的物理系統
把後牛頓波形和數值相對論波形拼接時,代價函數在參數空間裡有大量局部極小值,全局極小值落在一個又窄又淺的山谷裡,優化器很難找到。測試方法是跑約 60 個軌道的模擬,然後移動匹配窗口,看早期波形長什麼樣。結果是早期數值相對論波形和後牛頓波形看起來完全不同,等於把兩個不同物理系統的波形平滑地縫在一起,引入了偏差。
— Nils Deppe只讓神經網絡學後牛頓算不出來的那部分
後牛頓項每多算一項就是一篇博士論文的工作量,所以講者的思路是把神經網絡當成編碼所有他不想手寫的後牛頓項。網絡只需要約 100 個參數,訓練約 120 CPU 小時,在質量比空間裡只需要 8 條數值相對論波形。損失函數除了波形差異,還要求軌道速度接近、修正項在軌道速度趨於零時消失、以及等質量對稱性和權重正則化。
— Nils Deppe物理信息網絡在訓練集外推得更好
在質量比 9 比 5 這個訓練集之外的點上,後牛頓在接近併合時完全失效,surrogate 模型(訓練到質量比 8)隨著外推誤差變大,而物理信息神經網絡表現好得多。如果在已經訓練到質量比 8 之後再加一個質量比 15 的數據點,一直到質量比 15 的誤差都會大幅下降。這有望減少構建模型所需的訓練數據量。
— Nils Deppe純神經網絡方案需要一萬倍以上的訓練數據
講者說,他看到的其他用神經網絡建模波形的嘗試,大多是完全拋開物理、只用神經網絡或自編碼器,那樣真的需要 10 的 8 次方到 10 的 10 次方條波形來訓練,意味著你得先建好 surrogate 才能生成訓練數據,因為不可能拿到那麼多數值相對論波形。他的結論是:機器學習是有用工具,但別忘了你其實對要建模的東西是知道一些東西的。
— Nils Deppesurrogate 加速 30 到 40 倍,靠的是換算法
講者說,他做的不過是把代碼改得不那麼爛,沒有革命性的洞見。起點約 30 毫秒,現在約 30 到 40 倍加速。最大的加速來自換算法:從三次插值換成十階 Hermite 多項式,時間節點少得多。目前動力學部分佔了大頭,約 370 微秒,波形求值只要 50 微秒。他估計最終能給出 0.2 毫秒的頻率域波形,和最快的 phenom 波形相當甚至更好。
— Nils Deppe原話 · 已逐字校驗
anything that you agree with you should attribute to them anything that you disagree with you should attribute to me
你同意的任何東西都應該歸功於他們,你不同意的任何東西都應該歸咎於我。
Nils Deppe1:18
if I want a simulation that's twice as long in time, I will have a total error that's four times larger in a 3D simulation
如果我想要一個時間上兩倍長的模擬,在三維模擬中我的總誤差會大四倍。
Nils Deppe8:25
you're taking the PN wave from form from one system early on and stitching it to together with a waveform from a different physical system and then you combine them in a smooth way
你是在把早期來自一個系統的後牛頓波形,和來自另一個不同物理系統的波形縫在一起,然後用平滑的方式把它們組合起來。
Nils Deppe23:40
calculating post Newtonian terms is so difficult that like at this stage it's like one extra term is an entire PhD thesis
計算後牛頓項是如此困難,以至於在這個階段,多算一項就是一整篇博士論文。
Nils Deppe33:50
you should remember that you have physics like machine learning is is is a useful tool but don't forget that you actually maybe know something about the thing you're modeling
你應該記住你是有物理的,機器學習是個有用的工具,但別忘了你其實可能對你要建模的東西是知道一些東西的。
Nils Deppe44:58
I haven't done roughly speaking anything more than like fired a few neurons right like none of this was like I would say revolutionary like insight deep things this is just picking the code and making it not suck
粗略地說,我做的不過是動了幾個神經元,這些都不是我會稱之為革命性的深刻洞見,這只是把代碼撿起來讓它不那麼爛。
Nils Deppe55:08
I don't think I can give you a surrogate model that's faster than 0.2 two milliseconds for a frequency domain waveform for this kind of a system
我不認為我能給你一個比 0.2 毫秒更快的、針對這類系統的頻率域波形 surrogate 模型。
Nils Deppe57:10
數字與實體
| LIGO 目錄中夠用的模擬比例 | 約 85% 到 90%,約 3000 條 | 17:36 |
| 10 的 4 次方信噪比重系統夠用的模擬數量 | 約 10 條 | 16:33 |
| 物理信息神經網絡參數量 | 約 100 個 | 33:50 |
| 物理信息神經網絡訓練所需數值相對論波形數 | 8 條 | 33:50 |
| 物理信息神經網絡訓練時間 | 約 120 CPU 小時 | 33:50 |
| surrogate 加速倍數 | 約 30 到 40 倍 | 55:08 |
| 波形求值耗時 | 50 微秒 | 54:08 |
| 動力學部分耗時 | 370 微秒 | 55:08 |
| 目標頻率域波形耗時 | 0.2 毫秒 | 57:10 |
| 單次 LIGO 事件分析目標時間 | 30 分鐘以內 | 1:01:15 |
術語
- surrogate model代理模型
- 用少量數值相對論模擬插值出任意參數下波形的快速模型。
- physics informed neural network物理信息神經網絡
- 把已知物理方程寫進網絡結構,只讓網絡學修正項。
- post-Newtonian後牛頓
- 引力波早期旋進的近似解析展開,越接近併合越不準。
- mismatch失配
- 衡量兩個波形差異的指標,數值相對論中由相位誤差主導。
- co-orbital frame共軌道參考系
- 跟著雙星旋轉的參考系,讓波形更平滑、更容易建模。
收聽指南
做引力波數據分析、數值相對論或科學機器學習的研究生和工程師,尤其是想用物理約束降低訓練數據量的人。
開頭約 5 分鐘的會議介紹和探測器靈敏度曲線背景可以快進。