我一直是我自己。QED

把二十二年的文字交给AI重组一次。——肾上,雅集四年九月十九日

动机

2001年和2004年,先严和先慈相继去世后,我开始比较常规地写东西,07年我的rsywx.net域名注册完毕,站点开启,于是就一直用这个站点来发布我的文字。

22年来,我写了约1650篇博客文章(每年约75篇,4~5天一篇),约120万字,涵盖写作、读书、技术、生活等诸多方面。

博客的一个问题在于,它只是单纯地保存,只能提供最基本的文字搜索。所以,文章数量和文字数量上来之后,有三个问题必然出现:

  1. 我写过什么?
  2. 我想说什么?
  3. 更要命的是:我想说的东西,符合我自己坚守的公理么?

以及一个想法:能不能让别人也共享我的思考——一个RAG应用?

过程

AI来了之后,我有了“肾上の野望”:能不能让AI来完成这个工作?只说结论:可以,但代价很高。我的VPS硬件需要大幅升(jia)级(qian)才能完成。所以,最终答案是:不(mei)可(you)以(qian)。

还有一个是过程中发现的问题:RAG涉及的很多操作是黑盒的。

怎么切割、怎么索引、怎么理解问题、怎么找到答案、怎么组织回复……可中间发生了什么我看不见。模型读到了哪几篇、略过了哪几篇、凭什么这么回答,我都不知道。这让我很不放心……

方案

只能改变思路。前两天和朋友吃饭,谈到了Karpathy 写的LLM Wiki。我很快看了一下,要做的事情基本一样,但方向却正好相反。

它独到的地方是:基于来源,大模型过程化、增量地参与,并(如有必要)不断修正已有的结果

不是“你问、它答”,而是每读进一篇文章,就去改一批已有的页面——补一节、修一句、标一处矛盾、添一条互引。今天读一篇,改十页;明天读两篇,再改十几页。它不生成新答案,它改已有的稿子,而且每次只改一点。这就有点“训练”的味道了。

我决定试一试。过程TLDR,只说两个小点:

第一个是误读。它读错过东西,而且不是读漏,是读出了原文里没有的东西。

有一回它替我整理时间线,其中一条写着我某年生过一场病。没有这篇文章。

还有一处更值得记。它替我总结《叫魂》那一节,写成“晚明的合法腐败”、“官僚腐败走到极点、民不聊生”。听着很顺,很像这本书该有的样子——可原文里一个字都没有这些。《叫魂》讲的是乾隆三十三年,离晚明差着一百多年。

这两处都没有语病,都能读懂,都不刺眼。它们根本不像错误。

后来我给它定了两条规矩:原文一个字不许动;凡是引到原文的话,都得带一条能指回原文的链接。

第二条是关键。真话假话,光靠表面和考据分不出来;但只要每句话都能回查,假话就没有地方可藏。

第二个是误判。它比误读麻烦:不是读错了字,是判断越了界。

我让它做一件事:拿我自己立下的三条准则(简单·自洽·利他),去检验我自己有没有做到。

它交上来的初稿,把其中一条的定义悄悄收紧了一档——然后拿这个更严的版本,去证明我没做到。

这不是造假,是根据它认为合理的边界进行的判断。

我再给它立了一个规矩:这种涉及定义和边界的事,我需要有最终决定权。

=======

现在它是一个站点,一个不断自我更新、自我检验的站点。

二十二年的旧文一篇不动,按年份排好,各自留在原先的地址上。在这之上另起一层,把散在各处的线索收拢成主题:读书、编程、游记、影像、生活。每一条从原文取来的话,都能点回去。

另有一份日志,按天记着每一次改动是怎么发生的,包括那些改错的。

意义

这么做的意义有两个。

一是重新认识自己。

这件事我原本没打算做。可是把二十二年摊平、连成一片之后,我才第一次能拿这些字当证据——不是证明文章写得好不好,而是回答一个关于我自己的问题。

我在2024年给自己立过三条准则:简单、自洽、利他。

后来我把它们往回追了一遍:这三条是我今天才立的,还是我一直在做的?追下来,最早的不是2024年——2009年我写过一篇《BT群公理》,明说是仿《几何原本》五大公理写的;2015、2016年,另外几条线也各自长了出来。公理式的思维,比2024年早十五年。

最后得到我希望的结论:

我一直是我自己。QED

二是时时检测自己是否遵循自己的原则。

这一条比上一条更实际。

准则写下来的那天是没有约束力的。约束力来自有人回头查,而且反复地查。这套东西正好能这么用:博客还在写,新文章还在进来,每进来一篇,相关的页面就得跟着改一遍——它逼着你回去看。

最后

最后,我想说的是,这个过程技术含量和硬件要求非常低。

最本地化的实施方案包括以下三步:

  1. 准备好你的文字的备份。最好是结构化的,比如博客的导出文件(我的是XML格式),或者独立的文章(建议用MD格式)。
  2. 下载那个llm-wiki.md,打开一个支持agent的编辑器,(如有必要)做一些基本设定,用你自己熟悉的模型开始对话。而对话的第一句可以简单到:根据@llm-wiki.md的说明,对当前目录下我的博客/文章进行整理和汇编。
    1. 这个过程不会一次过,需要多次来回。
  3. 本地发布或者发布到自己的服务器。它发布的内容很少,且软硬件要求很低。

最后,贴上一张我的站点的图片:

最后的最后

从23年开始的AI探索暂时会停一段时间,之后将开始认真读书。

相关文章


Discover more from 生活在远方

Subscribe to get the latest posts sent to your email.

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *