AI出事后,美国目前唯一能开口的要求是:关掉所有大数据中心
因为能证伪安全承诺的核查技术还没造出来,国家级认证又要熬过数年审批,危机一来除了要求对方关停整座数据中心,没有折中选项。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 时间戳为按文稿位置估算
危机时刻能开的口,只有关停整座数据中心
哈里斯兄弟推演的链条是:中美互信基础薄弱,AI能力还在快速进步,一旦出现严重事故,现在唯一能验证对方是否服从的手段,就是要求对方关停某个规模以上的运行集群——因为卫星能看到的只有热信号这种粗糙指标。这个要求成本极高,GPU折旧是运营支出的大头,等于让对方烧掉几十亿美元资产。现在该做的,是把核查技术做到能替代「全停」这个选项,比如只需关一半、核查另一半,就能省下大笔钱。
— Ed Harris核查技术被情报界认证,通常要等数年
哪怕现在就有公司做出了可用的核查技术,情报界也不会立刻采信——历史上同类技术从研发到被正式认证为「国家技术手段」(NTM),往往要等数年。哈里斯建议现在就让核查初创公司和情报界的对口人建立联系,提前把研究方向对齐,这样真正出事时不用从零评估,能更快拍板该用哪种核查方式,而不是直接跳到「关闭所有数据中心」这种最贵的选项。
— Jeremy Harris判断对方是否真诚,看它愿不愿意主动暴露事故
比起一场措辞温和的演讲,哈里斯认为更有说服力的信号是:中国自己的监管机构是否开始在和美国前沿实验室同等细颗粒度上,通报自己系统出的问题——比如某个模型测试时「意识形态达标」,上线后却跑偏了。如果看到这种级别的自我暴露,会让人更相信对方真把「我们都在训练一个自己还不完全理解的东西」当成共同风险,而不是把安全话语当谈判筹码。
— Ed Harris超大云厂商的GPU比新兴云贵2到3倍,贵的不是芯片
Silicon Data的研究显示,亚马逊、微软这类大云厂商的GPU租金比新兴GPU专营云商稳定贵2到3倍,有时更高。Steve Ho的解释是:这不是芯片本身的差价,而是打包了企业早已依赖的合规、安全分析、长期服务关系——就像同一款汉堡,街边摊和高档牛排馆价格天然不同。这部分溢价没法简单拆分成「同款比价」,所以这类厂商被单独归为一个不可直接套利的类别。
— Steve Ho模型token价格看涨,其实是用户换着花更贵的模型
Silicon Data的token价格指数最近回弹,但Steve Ho提醒这不代表智能变贵了——从6月底到现在,头部模型的token报价本身一直在跌,曾一路从4美元跌到1.6美元,跌幅超过50%。指数回弹的真正原因是用户行为在变:更多人开始愿意多花钱用更贵的旗舰模型。这个指数是「支出加权」的,就像统计汽车均价时大家开始买贵的那一款,均价自然涨,但单位性能的价格仍在降。
— Steve Ho人类专家先找到那处基因缺失,AI只是后来复现
Daniel McKinnon的儿子Owen因罕见肺病去世,原始基因测序报告是「未确诊」。后来一位人类专家找到了被漏掉的病因:一处91千碱基的缺失,去掉了一段调控基因的增强子,这个区域离基因本体约有一百万碱基那么远——远超多数实验室设定的「只看基因上下游1千碱基以内」的常规过滤规则。Daniel后来自己写的AI分析流程重新发现了同一个答案,但顺序很关键:是人先找到的,AI只是复现,不是抢在所有人类专家之前诊断出来。
— Daniel McKinnon专用基因变异工具命中10%,通用大模型裸跑命中50%
Daniel的公司Gamow Labs维护着一个叫Rarebench的基准,专门测试给致病变异排序打分的能力。表现最好的传统机器学习工具Lyrica,在这个基准上大约只能打到10%。而什么都没特别优化、直接在Cloud Code里跑的Opus 5.5,裸模型就能打到50%左右。对比更极端的是,最早期的o3模型在这个基准上是0%。这个落差是Daniel创业的核心判断依据:这件事不该靠专用小模型死磕,该靠前沿通用模型加好的harness。
— Daniel McKinnon放慢AI速度的代价,是一半家庭仍等不到诊断
节目收尾时Nathan承认,支持给前沿AI进度「踩刹车」这件事是有真实代价的:Gamow现在用的模型在Rarebench上大约能解答50%的疑难病例,意味着另一半家庭的问题依然悬而未决。他仍然认为整体上值得为安全做一些妥协,前沿公司也不会因为放慢就失去商业增长空间,但他强调这不是免费的选择——对具体某个家庭来说,这是一笔实实在在、代价高昂的交换。
— Nathan Labenz原话 · 已逐字校验
Certain kinds of transparency can be stabilizing. So the the kind of transparency that goes like, hey. We're giving you enough vision into what we're doing to see that we are not doing the thing you fear most.
某些类型的透明度能起到稳定作用。那种「嘿,我们让你有足够的能见度,看到我们没有在做你最害怕的那件事」式的透明。
Ed Harris0:21
data centers put off a hell of an energy footprint. You know, the thermals on those are really, really bright. Data centers are huge.
数据中心会释放出极大的能源足迹。那种热信号真的非常非常亮。数据中心本身也很大。
Jeremy Harris5:57
So how long did it take similar technologies in the past to get used, to get vetted, and to become what's known as national technical means, NTMs? Right? And the answer is is years, depending on the technology, but very often years.
过去类似的技术要花多久才能被使用、被审核,成为所谓的「国家技术手段」(NTM)?答案是要花数年时间,视技术而定,但往往就是数年。
Jeremy Harris10:31
So in the case of hyperscalers, indeed, you are observing correctly. They charge regularly, consistently, at least two to three times, sometimes more compared to a typical a new cloud.
对于超大型云厂商来说,你的观察没错。他们一贯地、稳定地收费,至少是普通新兴云商的两到三倍,有时候更高。
Steve Ho34:31
since, like, maybe late June through, like, basically, you know, middle of this month, it has been on a very sharp downward trend of going from some $4 to, what, you know, 1.6 or something that's more than 50% drop.
从大概6月底到这个月月中,它一直处在非常陡峭的下跌趋势里,从大约4美元跌到1.6美元左右,跌幅超过50%。
Steve Ho39:31
this enhancer is a megabase 1,000,000 bases up upstream from the gene.
这个增强子在基因上游一兆碱基、也就是一百万个碱基那么远的地方。
Daniel McKinnon1:01:22
the best performing, like, I'd say, machine learning based approach in terms of variant ranking is called Lyrica. I think it scores something like 10% on our benchmark. And right now, Opus 5.5 in Cloud Code, just a vanilla thing, scores something like 50%.
在变异排序上表现最好的机器学习方法叫Lyrica,我们的基准上它大概能打10%分。而现在,Cloud Code里裸跑的Opus 5.5,什么都没特殊处理,能打到大约50%。
Daniel McKinnon1:08:07
I don't think the frontier model companies are at risk of, like, not being able to grow business, not being able to grow revenue, becoming surpassed if they pace their frontier efforts.
我不认为前沿模型公司会因为放慢前沿研发的步伐,就面临做不大生意、增长不了收入、或者被别人超越的风险。
Nathan Labenz1:22:42
数字与实体
| 超大云厂商GPU租金对新兴云商的溢价 | 2至3倍,有时更高 | 34:31 |
| 头部专有模型token报价跌幅(6月底至今) | 从约4美元跌到1.6美元,跌幅超50% | 39:31 |
| ACMG变异评分升级为「可能致病」所需分数 | 6分以上 | 1:04:16 |
| 一次功能验证实验可带来的ACMG加分 | 2至4分 | 1:06:33 |
| Rarebench基准得分:传统工具Lyrica vs 裸跑Opus 5.5 | 10% vs 50% | 1:08:07 |
| o3模型最初在Rarebench上的得分 | 0% | 1:18:14 |
| Joel Borgen对AI初稿的编辑删减比例 | 约14% | 52:11 |
术语
- VUS意义未明的变异
- 基因变异尚无法判定良性或致病,处于中间不确定状态
- ACMG美国医学遗传学与基因组学学会评分标准
- 临床上给基因变异致病性打分分级的通用规则
- NTM国家技术手段
- 被情报界正式认证、可用于核查对方合规的技术能力
- enhancer增强子
- 远离基因本体、但能调控其表达强弱的DNA区域
- neocloud新兴GPU云商
- 专营GPU算力租赁的新云服务商,区别于亚马逊微软等大型云厂商
收听指南
关心中美AI博弈机制、云算力定价套利空间、或垂直领域AI诊断实际效果的创业者和投资人。
对AI写小说的创作过程不感兴趣,可跳过47:30-58:10这段。