我硬盘中有一个名为 D:\Books 的文件夹,里面存放了200多本电子书,堆积已有三年。文件格式混杂,包括PDF、EPUB、TXT等,文件命名也极为杂乱,从“asdf1234.pdf”到“《穷查理宝典》完整版最终版真的最终版.pdf”,让我自己都难以快速找到需要的书。
这周我做了一件事情,将这些电子书全部导入WorkBuddy的资料库。现在,我只需一句话,就能在三秒钟内得到答案,比如“这200本书中,有多少提到‘复利’这个概念?”它会列出相关的书名、章节和原文句子。
导入之前,我先对文件夹进行了整理。WorkBuddy支持直接导入PDF、Word、TXT、PPT和Excel等常见格式,但EPUB格式需要转换成PDF或TXT才能解析。我用一条指令让它自动整理文件:“扫描D:\Books,按‘职场管理/技术编程/投资理财/公版文学/未分类’五个类别建立子文件夹;通过目录或前言判断所属类别并自动移动;文件名统一改为《书名-作者-年份》;无法判断类别的放入‘待分类’,并列出清单,不要乱猜。”它利用本地沙箱遍历文件,识别类型,重命名并建目录,用了十分钟就将这些电子书整理成了可以使用的书架。
在整理过程中遇到两个难题:扫描版PDF多为图片,没有OCR就无法提取文字。我有30多本扫描件,WorkBuddy识别出来全是空白。解决方法是用Adobe或WPS先进行OCR处理,然后再导入系统,即刻可以读取内容。另一类是受DRM限制或加密的PDF。这些文件会被静默跳过。部分从付费平台下载带复制限制的电子书也会出现内容为空的问题。应先用Adobe Acrobat解除限制或寻找无DRM版本。
接下来是建库和入库工作。我在WorkBuddy左侧“资料库”菜单中新建了一个叫“个人图书馆”的本地知识库,以确保数据仅存储在本机,不担心敏感内容泄露。我分三批次逐步拖入每次60到70本,总共200多本。官方说明指出:导入后系统会自动解析文档、分块和向量化存储,全流程实现自动化。我平均每本解析时间20到40秒,一次批量导入耗时大约一个小时,期间电脑正常使用,没有卡顿。

最关键的是我没有一上来就让WorkBuddy全文阅读所有内容,而是先生成“书目卡”。我提出:“对每一本书,只提取:书名、作者、出版年份、核心主题一句话以及3到5个关键概念”,然后输出一份包含200行的总表。一眼浏览后,我就能清楚知道每本书的核心信息,从而决定是否深入挖掘。例如,如果我要查找《思考,快与慢》中关于“锚定效应”的段落,只需在系统中定位,快速找到原文,比自己翻阅还快十倍。
目前,这个系统已能帮我完成三项任务:跨书检索,比如问“哪些书同时提到‘长期主义’和‘复利’”,它会筛选出符合条件的7本,并附带相关段落;反向索引我的读书笔记,只要问“我在哪篇笔记中引用过芒格?”,它就能定位到三年前写的那篇《穷查理宝典》的读后感,连我自己都忘记写过;以及提供写作素材,比如问“找5个关于‘延迟满足’的案例,要有出处”,它可以从不同书籍中组合出案例,并带上可验证的原文引用,而非凭空捏造。
需要提醒的是,公版电子书或自己购买的电子版没有问题,但大量上传带有版权限制的内容用于公开分发则不太安全。在设置知识库时,应定位为个人检索工具。此外,为避免AI误操作修改源文件,建议将原始资料设为只读。这一点官方教程也特别强调。
现在,我每天开机第一件事不是翻找文件夹,而是向我的“图书馆”提问。从堆满灰尘的电子书变成随时可以调用的知识资源,只差一个完善的数据仓库。你硬盘里那些堆满电子书的文件夹,也该考虑让它们重新焕发生机了。