連紅隊測試自己系統都被AI公司拒絕,催生了去審查模型生意
它把「要不要拒絕執行」的判斷權交還給客戶自己設定,這解釋了為什麼連財富500強的CISO都願意找一家公開標榜「去審查」的模型供應商做紅隊測試。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
前沿實驗室會主動拒絕合法客戶
Devin Thomas創辦Obliteration.ai的起點,是發現一批做網絡安全、生物研究、合成數據和防務工作的專業人士和公司,被前沿實驗室的模型默認當成「不該服務」的對象直接拒絕。這些人不是想幹壞事,而是日常工作本身就需要無限制地測試攻擊手法或生成敏感數據,卻被主流大廠的安全策略一刀切擋在外面。Obliteration的定位就是專門接住這批長期被忽視的需求,靠這批客戶迅速打開市場、獲得大量媒體關注。
— Devin Thomas防守方拿不到進攻方的同款模型
Jason給出一個具體場景:如果OpenAI想測試對Hugging Face的攻擊能力,用的是自己最新最強的模型;但Hugging Face要防禦,卻拿不到OpenAI那個版本。Devin證實這個不對稱是真實存在的——而且不只是中小創業公司在抱怨,一些本身已經拿到特殊網絡安全項目權限的大公司,也仍然在為模型「拒絕執行」測試指令而頭疼。被擋在外面的不是能力不夠的人,而是正規軍。
— Devin Thomas / Jason Calacanis護欄該由客戶自己定義,不是廠商
Obliteration的產品設計不是簡單粗暴地刪掉模型的安全限制,而是做成兩層架構:底層是被去掉原生拒絕行為的開源模型,上面另加一個獨立的小模型專門跑護欄策略,由客戶自己配置哪些事能做、哪些不能做。Devin把這個設計稱為「控制權反轉」——以前是模型廠商替所有客戶決定界限,現在客戶可以按自己行業的合規要求,把某些領域設得比原廠更嚴,某些領域設得更松。
— Devin Thomas錘子傷人,造錘子的人不擔責
被問到誰該為濫用負責,Devin用「賣錘子」類比撇清Obliteration的法律風險:公司要求每個用戶用真實信息註冊Stripe付費,留下可追溯的痕跡;法律目前的責任認定落在使用工具的人身上,就像有人拿錘子打人,錘子廠和五金店都不擔責。Obliteration不提供執行層的agent能力,只負責「給信息、拿信息」,信息拿去做什麼是用戶自己的事——他把自家角色比作那個裝錘子的紙袋。
— Devin Thomas前沿優勢窗口已縮至三個月
Anthropic自己發博客承認,經過去審查處理的GLM在網絡安全能力上已經逼近前沿水平,這被Devin視為行業焦慮的來源——frontier(前沿)這個詞本身暗示一種「永遠領先、差距不會消失」的排名秩序,但現實是這條護城河在以超出預期的速度縮短:以前落後大約一年,現在大概只差三個月。當各家模型能力逐漸趨同,靠「我們是前沿」講估值故事會越來越難。
— Devin Thomas資源一旦過剩,實驗室就愛闖禍
談到AI公司的爬蟲、紅隊行為為何容易越界,Devin給出一個少見的解釋:實驗室規模越做越大、研究員越來越多,這些人本身就需要找事情證明自己對公司有價值,於是不斷加大測試強度、提高獎勵函數的激進程度。Jason當場評價這是他「從沒聽人講過、但可能相當準確」的洞察:資源一旦過剩,「做點什麼證明自己有用」本身就會製造風險,不一定是某個明確的惡意決策導致的。
— Devin Thomas / Jason Calacanis時薪不會消失,但定價邏輯在變
針對AI會不會終結按小時收費的爭論,Jason的反例是:PC、雲計算、互聯網這些此前的顛覆性技術都沒有消滅按時間付費這件事,人們永遠有時間和工具。真正改變的是定價支撐點——簡單文件不再需要律師按小時收費,但專家用AI工具能在更短時間內交付更好的結果。他進一步用高價設計師和婚紗舉例:客戶花大價錢買的從來不是效率,而是認領這個過程、承擔經驗和背書的那個人。
— Jason Calacanis創始人該消滅風險,不是擴編
面對「AI會不會讓投資人不再偏愛多人創始團隊」的提問,Jason說效率從來不是問題,單人高強度創始人一直存在;真正的瓶頸是早期階段任務切換成本太高,一個人很難同時搞定產品市場匹配、招聘和融資。他給出一個決策框架:把三人、兩人、單人團隊放進同一個袋子搖勻抽取,投資人會按三、二、一的順序投,除非這個單人創始人已經證明自己能消滅某一項具體風險——比如做出持續增長的產品市場契合度,或者已經有穩定上漲的銷售額,風險一旦被消滅,估值和融資意願才會跟著上去。
— Jason Calacanis原話 · 已逐字校驗
And even if they have access to those special cyber programs, still, many of them, our customers are still complaining about refusals. And these are big corporations.
即便他們已經拿到了那些特殊的網絡安全項目權限,很多客戶仍然在抱怨模型拒絕執行。而且這些還是大公司。
Devin Thomas3:06
Like if someone goes and takes a hammer and hits someone with it, right? Like the creator of the hammer is not necessarily liable in that case, right?
就好比有人拿起一把錘子去打人,錘子的製造者在這種情況下並不一定要承擔責任。
Devin Thomas7:21
Maybe before it was a year, they were a year behind. I would say today they're maybe around three months behind.
也許以前他們落後一年,我覺得現在大概只落後三個月左右。
Devin Thomas9:25
I think it's kind of like if it bleeds, it leads type situation, where it's like it just people love these stories of these hacks.
我覺得這有點像「見血才是頭條」那種情況——人們就是喜歡這些黑客故事。
Devin Thomas13:33
That's actually an insight I've never heard anybody make, Devin, that is actually perhaps super accurate, which is when you have an unlimited amount of resources and people looking to make an impact inside a company, they will try to have an impact.
Devin,這其實是我從沒聽人說過、但可能相當準確的一個洞察:當你有無限的資源,而人們又想在公司裡做出影響力,他們就會想方設法去製造影響力。
Jason Calagans17:43
So the question is, is this tool so transformative that adding a person's time becomes irrelevant?
所以問題是,這個工具是不是顛覆性到讓人的時間投入變得無關緊要了?
Jason Calagans32:02
So what risk can you eliminate? With three co-founders, you're eliminating one co-founder quitting risk, right?
所以你能消滅什麼風險?如果有三個聯合創始人,你消滅的是某個聯合創始人中途退出的風險。
Jason Calagans50:42
數字與實體
| 前沿模型與去審查開源模型的網絡安全能力差距 | 從約1年縮短到約3個月 | 9:25 |
術語
- Abliteration去審查術/模型祛魅
- 定位並修改模型中負責拒絕回答的神經元,以此解除安全護欄
- Inversion of control控制權反轉
- 把護欄設定權從模型廠商轉移給使用模型的客戶自己
- DeepSeekDeepSeek
- 中國開源大模型公司,逐字稿中被語音轉寫誤寫為DeepSea
收聽指南
網絡安全紅隊從業者、企業CISO、關注開源模型商業化和AI創業定價策略的創始人與投資人。
節目中段Odoo、Northwest Registered Agent等贊助廣告片段可直接跳過。