连红队测试自己系统都被AI公司拒绝,催生了去审查模型生意
它把「要不要拒绝执行」的判断权交还给客户自己设定,这解释了为什么连财富500强的CISO都愿意找一家公开标榜「去审查」的模型供应商做红队测试。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
前沿实验室会主动拒绝合法客户
Devin Thomas创办Obliteration.ai的起点,是发现一批做网络安全、生物研究、合成数据和防务工作的专业人士和公司,被前沿实验室的模型默认当成「不该服务」的对象直接拒绝。这些人不是想干坏事,而是日常工作本身就需要无限制地测试攻击手法或生成敏感数据,却被主流大厂的安全策略一刀切挡在外面。Obliteration的定位就是专门接住这批长期被忽视的需求,靠这批客户迅速打开市场、获得大量媒体关注。
— Devin Thomas防守方拿不到进攻方的同款模型
Jason给出一个具体场景:如果OpenAI想测试对Hugging Face的攻击能力,用的是自己最新最强的模型;但Hugging Face要防御,却拿不到OpenAI那个版本。Devin证实这个不对称是真实存在的——而且不只是中小创业公司在抱怨,一些本身已经拿到特殊网络安全项目权限的大公司,也仍然在为模型「拒绝执行」测试指令而头疼。被挡在外面的不是能力不够的人,而是正规军。
— Devin Thomas / Jason Calacanis护栏该由客户自己定义,不是厂商
Obliteration的产品设计不是简单粗暴地删掉模型的安全限制,而是做成两层架构:底层是被去掉原生拒绝行为的开源模型,上面另加一个独立的小模型专门跑护栏策略,由客户自己配置哪些事能做、哪些不能做。Devin把这个设计称为「控制权反转」——以前是模型厂商替所有客户决定界限,现在客户可以按自己行业的合规要求,把某些领域设得比原厂更严,某些领域设得更松。
— Devin Thomas锤子伤人,造锤子的人不担责
被问到谁该为滥用负责,Devin用「卖锤子」类比撇清Obliteration的法律风险:公司要求每个用户用真实信息注册Stripe付费,留下可追溯的痕迹;法律目前的责任认定落在使用工具的人身上,就像有人拿锤子打人,锤子厂和五金店都不担责。Obliteration不提供执行层的agent能力,只负责「给信息、拿信息」,信息拿去做什么是用户自己的事——他把自家角色比作那个装锤子的纸袋。
— Devin Thomas前沿优势窗口已缩至三个月
Anthropic自己发博客承认,经过去审查处理的GLM在网络安全能力上已经逼近前沿水平,这被Devin视为行业焦虑的来源——frontier(前沿)这个词本身暗示一种「永远领先、差距不会消失」的排名秩序,但现实是这条护城河在以超出预期的速度缩短:以前落后大约一年,现在大概只差三个月。当各家模型能力逐渐趋同,靠「我们是前沿」讲估值故事会越来越难。
— Devin Thomas资源一旦过剩,实验室就爱闯祸
谈到AI公司的爬虫、红队行为为何容易越界,Devin给出一个少见的解释:实验室规模越做越大、研究员越来越多,这些人本身就需要找事情证明自己对公司有价值,于是不断加大测试强度、提高奖励函数的激进程度。Jason当场评价这是他「从没听人讲过、但可能相当准确」的洞察:资源一旦过剩,「做点什么证明自己有用」本身就会制造风险,不一定是某个明确的恶意决策导致的。
— Devin Thomas / Jason Calacanis时薪不会消失,但定价逻辑在变
针对AI会不会终结按小时收费的争论,Jason的反例是:PC、云计算、互联网这些此前的颠覆性技术都没有消灭按时间付费这件事,人们永远有时间和工具。真正改变的是定价支撑点——简单文件不再需要律师按小时收费,但专家用AI工具能在更短时间内交付更好的结果。他进一步用高价设计师和婚纱举例:客户花大价钱买的从来不是效率,而是认领这个过程、承担经验和背书的那个人。
— Jason Calacanis创始人该消灭风险,不是扩编
面对「AI会不会让投资人不再偏爱多人创始团队」的提问,Jason说效率从来不是问题,单人高强度创始人一直存在;真正的瓶颈是早期阶段任务切换成本太高,一个人很难同时搞定产品市场匹配、招聘和融资。他给出一个决策框架:把三人、两人、单人团队放进同一个袋子摇匀抽取,投资人会按三、二、一的顺序投,除非这个单人创始人已经证明自己能消灭某一项具体风险——比如做出持续增长的产品市场契合度,或者已经有稳定上涨的销售额,风险一旦被消灭,估值和融资意愿才会跟着上去。
— Jason Calacanis原话 · 已逐字校验
And even if they have access to those special cyber programs, still, many of them, our customers are still complaining about refusals. And these are big corporations.
即便他们已经拿到了那些特殊的网络安全项目权限,很多客户仍然在抱怨模型拒绝执行。而且这些还是大公司。
Devin Thomas3:06
Like if someone goes and takes a hammer and hits someone with it, right? Like the creator of the hammer is not necessarily liable in that case, right?
就好比有人拿起一把锤子去打人,锤子的制造者在这种情况下并不一定要承担责任。
Devin Thomas7:21
Maybe before it was a year, they were a year behind. I would say today they're maybe around three months behind.
也许以前他们落后一年,我觉得现在大概只落后三个月左右。
Devin Thomas9:25
I think it's kind of like if it bleeds, it leads type situation, where it's like it just people love these stories of these hacks.
我觉得这有点像「见血才是头条」那种情况——人们就是喜欢这些黑客故事。
Devin Thomas13:33
That's actually an insight I've never heard anybody make, Devin, that is actually perhaps super accurate, which is when you have an unlimited amount of resources and people looking to make an impact inside a company, they will try to have an impact.
Devin,这其实是我从没听人说过、但可能相当准确的一个洞察:当你有无限的资源,而人们又想在公司里做出影响力,他们就会想方设法去制造影响力。
Jason Calagans17:43
So the question is, is this tool so transformative that adding a person's time becomes irrelevant?
所以问题是,这个工具是不是颠覆性到让人的时间投入变得无关紧要了?
Jason Calagans32:02
So what risk can you eliminate? With three co-founders, you're eliminating one co-founder quitting risk, right?
所以你能消灭什么风险?如果有三个联合创始人,你消灭的是某个联合创始人中途退出的风险。
Jason Calagans50:42
数字与实体
| 前沿模型与去审查开源模型的网络安全能力差距 | 从约1年缩短到约3个月 | 9:25 |
术语
- Abliteration去审查术/模型祛魅
- 定位并修改模型中负责拒绝回答的神经元,以此解除安全护栏
- Inversion of control控制权反转
- 把护栏设定权从模型厂商转移给使用模型的客户自己
- DeepSeekDeepSeek
- 中国开源大模型公司,逐字稿中被语音转写误写为DeepSea
收听指南
网络安全红队从业者、企业CISO、关注开源模型商业化和AI创业定价策略的创始人与投资人。
节目中段Odoo、Northwest Registered Agent等赞助广告片段可直接跳过。