尝试打破一些旧有形式,让自己的一些想法能快速地流动起来,得到碰撞。当然,没时间录播客时,写文章的一个目的,依旧是想要分享一些好听的音乐,仅此而已。
最近在做 flomo 的语音输入时,其中有个部分是用大模型来将录音的文字进行改写。
这本是 AI 最擅长,也是技术上相对比较简单的部分,但是却卡了我很久。
卡的原因,在于我们如何看待「AI 生成」的内容。
最初,该功能名为「AI 润色」,提供三种模式:标准、一句话概述和结构化。

标准模式当时写的 Prompt 是希望能书面化一点方便阅读;结构化是受一泽分享卡片的启发(如下图),可以把一段语音叙述拆成类似大纲的结构,尤其是自己叙述没有那么逻辑严谨时,效果确意外地好。

这看起来司空见惯,毕竟许多 AI 工具都提供这样的功能。但真正拿到 DEMO 用起来时,就发现了问题在哪里:AI 帮忙润色的太好了。
润色的好不恰好是一个 AI 的卖点么?单纯从产品的角度来看,的确如此,能让用户快速感受到 AI 的价值。但如果把时间拉长,就会发现这样「美化」过的内容,其实是一种负资产。
就像虽然我发照片时也会偶尔加加滤镜,调调色。但相册中肯定保留的有原片,因为我不希望多年以后查看的时候是个过度美化的照片 —— 真实地存在,本身就很有力量。
回到文字,如果本身自己说出来的内容是磕绊的,不完整的,逻辑有瑕疵的,但 AI 很方便地将这些缺陷都给抹掉,把内容变得更加精致地存起来。随着时间推移,当积累了太多这样「美化」过的内容后,自己是否会产生一种幻觉,觉得自己的思维是清晰的,表达是严谨的?
就算相册里面存满 P 过的照片,现实中自己是什么样,就还是什么样子;
就算是笔记中充满了润色好的内容,现实中自己认知如何,就还是如何;
这让我想起 Alan Kay 在二十多年前的 SCIx上的演讲 中的一段话,用来放在扑面而来的 AI 时代,也非常贴切:
每当你创造一个工具的时候,你既做了一个增强器又做了一个假肢。汽车在一定程度上增强了我们,同时在另一方面弱化了我们的身体。 有了汽车以后我们必须主动去运动才能保持健康。文字书写是一个很革命性变化,而苏格拉底却埋怨说书写让人健忘,因为有了写下来的东西,人们就不会用脑子记东西了。
谜底就在谜面上,困扰了我许久 flomo 的 AI 到底该怎么做的问题,突然解开了。
因为当 AI 能处理所有信息时,人类为什么需要主动记录思考?只因为那些粗糙的、残缺的、跳跃的、遗憾的、片面的,才是真实的,才是我们作为人类,独特的价值。
flomo 应该帮助大家记录的,是自己真实思考的痕迹。 也只有真实的持续记录,才有浮现出来意义的可能。
而 AI ,应该用来基于这些真实的记录,帮助我们探索出这些记录背后隐藏的连接,涌现出更多值得自己思考的问题。
比如基于自己真实的相关笔记,涌现出自己探索的主题;以及围绕主题,提出更多让自己深入洞察自己的问题等。

而当自己的笔记中充斥着快速总结、生成、润色的内容,看效率很高,智商得到了美化,但那只不过是另一种形式的仓库而已。因为大脑缺少了记录时的摩擦,会导致自己遇到问题时,根本无法提取出来对应的问题。
没有具体的问题,再多的答案也没有价值,即使有了 RAG 也不行。
所以在语音输入上线之前,我们把「AI 润色」改为了「AI 转写」,去掉了自定义功能,只留下简单的 Prompt:
阅读全文,只修复听写错误,精简无意义的语气词,并按说话主题换行,其他保持原始语音细节不变。绝对不修改句式,不删减内容,保持真实。
因为只有这样,才能如即友豪伊说的:在 flomo 写下的思考,就是留给未来自己 Prompt。 🆃
