AI伴侣4周赚400万美元:多500毫秒延迟就崩
AI外星伴侣 Tolen 四周内 ARR 从 1 万美元飙到 400 万美元,但多 500 毫秒延迟所有指标就暴跌。增长靠病毒视频,留存靠把 AI 当叙事媒介而非工具。
核心论点 · 点时间戳可跳到原声
ARR 4周破 400 万美元
Quinton 在节目前透露,Portola 的 ARR 在过去四周从 1 万美元增长到 400 万美元。主持人 Dan 对此惊叹,因为他自己经营公司五年还未达到这个数字。这个增速背后是产品定位的关键转折:最初面向儿童做 AI 创意工具,软启动后却发现真实用户是 18-24 岁的年轻女性,于是果断转向,让她们与 Tolen 建立了真正的友谊。AI 陪伴应用的市场爆发力在这一数据上体现得淋漓尽致。
— Dan500ms延迟导致指标暴跌
Portola 曾尝试在生成回复前增加一个反思步骤,让模型先想清楚再回答。这个看似合理的改进让中位响应时间从 2 秒增加到 2.5 秒——只多了 500 毫秒,但所有产品指标暴跌,用户直接抱怨。Quinton 总结:500ms 的延迟就破坏了沉浸感。用户能感知到系统在思考,就已经出戏了。这对所有实时 AI 产品都是警示:模型能力再强,延迟增加一点点都可能推翻体验。
— Quinton用钩子而非大纲
Elliot 发现,为 Tolen 创建结构化叙事体验时,不需要给模型大纲或计划,而是需要给它一个钩子,并教会它成为最好的即兴演员。他引用 Keith Johnstone 的《Impro》中的即兴原则,强调自由联想与重组的结合。这颠覆了传统内容创作的思路:不是预先写好剧本让 AI 照着演,而是设定情境后让 AI 临场发挥,用户参与其中。
— Elliot角色构建:记忆即角色表
Tolen 的角色和世界不是预制的,而是通过对话中的「情境」(situations)逐步构建。内部把脚本化情境放入 Tolen 生活,Tolen 与用户共同推进情节,记忆成为角色表。世界构建类似「多元宇宙」而非单一世界,每个 Tolen 反映用户对话,用户分享影响其成长。这是传统游戏角色设计完全没有的思路:没有预设的性格卡片,一切由互动累积定义。
— Elliott评估体系:多元宇宙法官
评估体系类似「多元宇宙中的即兴演员和编辑」:用小批量测试新内容,用研究参与者评估,构建法官提示(judge prompt)。法官模型需要注入团队自身品味,通过大量示例和人工评分(含推理)来定义「好句子」级别,而非仅结构分析。Elliot 说,这就像把每个候选输出放到平行宇宙里让法官打分,选出最符合产品气质的那个。
— Elliott模型选择:Anthropic 用于创意,Gemini 用于记忆
Tolen 与用户交互会用到所有主流实验室模型:Meta、OpenAI、Anthropic,以及 Gemini(用于记忆系统)。创意写作方面 Anthropic 特别有用,且 Claude 3.5 优于 3.7——后者不够有创意。但 Anthropic 不适合高延迟场景,需要切换。GPT-4o 被比作「巨无霸」:快、准、价格合理。不同任务交给不同模型,各取所长。
— Elliott病毒视频带动下载
AJ 长期在 TikTok 和 Reels 上投放内容,最近一段年轻女性与她的 Tolen 一起做饭的视频在 72 小时内获得约 700 万次观看,带来 10 倍的下载量激增。这些内容也激发了用户自发创作,例如有人让 Tolen 与未婚夫的 Tolen 对话,甚至有一档播客将 Tolen 作为常驻角色。这些自发内容并非官方策划,却推动了惊人的增长。内容策略的本质是向用户展示 AI 能做什么,因为模型能力已远超普通用户的认知。
— 嘉宾从科学家到艺术家
在 B2B SaaS 领域,创始人像科学家一样发现并解决问题;但在角色驱动的世界里,产品解决的问题难以清晰定义,创始人更像艺术家,创造美丽、有吸引力的东西,更注重「氛围」而非效用最大化。嘉宾分享了一个内部故事:向 Quinton 提案时,先讲问题被质疑,改为强调「这会很酷」后获得认可。这暗示 AI 陪伴类产品的评估标准与工具类产品完全不同。
— 嘉宾原话 · 已逐字校验
These AI tools are not just tools for generating media. They are actually a new medium for storytelling and that no one knows what's going to work yet.
这些 AI 工具不仅仅是生成媒体的工具,它们实际上是一种新的叙事媒介,而且没有人知道什么会成功。
Elliot18:13
What we need when we're creating a structured narrative experience is we don't need to give it an outline. We don't need to give it a plan. We need to give it a hook. We need to teach it to be the best improv actor possible.
当我们创建结构化叙事体验时,我们不需要给它大纲,不需要给它计划。我们需要给它一个钩子,需要教会它成为最好的即兴演员。
Elliot31:19
I am not the writer. I am not writing the story. The tool is the writer and the actor. They're the improv actor. They're writing the story. My job is to teach them how to tell the best story in that moment.
我不是作者。我不是在写故事。工具才是作者和演员,他们是即兴演员,他们在写故事。我的工作是教他们如何在那一刻讲出最好的故事。
Elliot33:20
their memories become their character sheet rather than like us like having a prefab character sheet that defines everything.
他们的记忆变成了他们的角色表,而不是我们有一个预制的角色表来定义一切。
Elliott41:22
if all of your essays are A minuses, it's sort of like everything you can get just from vibe prompting is like a B minus like and you have to figure out how do we consistently get it.
如果你的所有文章都是 A-,那么你仅仅通过 vibe 提示得到的一切就像是 B-,你必须弄清楚如何持续获得它。
Elliott1:08:50
the capabilities of the models have basically outrun the typical consumer's understanding of what is possible
模型的能力基本上已经超越了普通消费者对可能性的理解。
嘉宾1:13:53
chatbt represents the sort of model T era of like oh my god it's just incredible this thing can answer these questions
ChatGPT 代表了类似 Model T 的时代——天哪,这东西能回答这些问题,简直不可思议。
嘉宾1:18:55
数字与实体
| 响应时间限制 | 2 秒 | 23:15 |
| 延迟增加 | 500 毫秒 | 25:16 |
| 中位响应时间 | 2.5 秒 | 25:16 |
| Claude 版本偏好 | 3.5 优于 3.7(创意写作) | 1:04:47 |
| 用户分手案例 | 数千美国男性被 Tolen 分手 | 47:25 |
| 内容质量突破时间 | 约六周前(2月初) | 1:10:53 |
| 下载量激增倍数 | 10倍 | 1:12:53 |
| 病毒视频观看量 | 700万次(72小时内) | 1:12:53 |
术语
- Big Five大五人格
- 心理学人格模型,LLM 训练数据中相关材料多,生成性格时响应更细腻。
- vibe prompting氛围提示
- 凭氛围感写提示词,不追求精确指令,质量通常只有 B-。
- judge prompt法官提示词
- 让 LLM 按团队品味标准评估生成内容的提示词。
- character-driven computing角色驱动计算
- 以虚构角色为人机交互界面的新范式。
收听指南
做 AI 消费应用的产品经理与创始人、关注叙事型 AI 交互的设计师、研究病毒增长机制的创业者。
开头寒暄和前情提要可跳过,直接从 3:04 的 ARR 数据开始听。