最近翻到一个GitHub项目,叫 ebook-treasure-chest(电子书下载宝库)。看了下里面的东西,有点意思,顺手写一篇介绍。
24000本书,一个项目全搞定
先说我自己的经历。
前阵子朋友推荐了一本书,说写得特别好。我去电商平台搜了一下,发现要充会员才能下载。又去网上找免费资源,翻了好几页,要么格式不对,Kindle打不开,要么下下来是一堆乱码。折腾了半小时,书没看成,心情倒是搞没了。
后来在GitHub上刷到这个项目,点进去一看——两万多本书,按分类整理得清清楚楚,EPUB、MOBI、AZW3三种格式全都有。直接搜书名,点一下就能下。
就这么简单。
这个项目到底有多大?
先看几个数字:
- 来源平台:帆书(原樊登读书)、微信读书、京东读书、喜马拉雅等
24000本书是什么概念?如果每天读一本,要连续读65年才能看完。1000个分类又是什么概念?从文学到量子物理,从二战史到咖啡文化,几乎你能想到的阅读方向,里面都有对应的分类。
文学类2700多本,历史类1700多本,科普类700多本。管理、社会、推理、哲学、传记、心理、金融、投资……每个分类下面少则上百本,多则上千本。
这不是一个随便收集了几本书的个人网盘,这是一个成体系的书库。
这个宝库是怎么建起来的?
项目结构挺清晰的。
自动化采集。 项目里有一个 scripts/ 文件夹,里面放着自动抓取、整理、分类电子书信息的脚本。两万多本书不是人工一本一本录入的,而是通过程序自动采集、清洗、分类后形成的。
Markdown文件做分类。 每一个分类都是一个独立的Markdown文件——文学.md、历史.md、科普.md……里面列出了该分类下的所有书籍,每本书都包含书名、作者、下载链接和三种格式的下载地址。这种做法的好处是:文件本身就是数据库,修改方便,更新也容易。
GitHub Pages做搜索。 项目部署了一个在线搜索页面,支持实时搜索和多关键词搜索。你不需要在几百个Markdown文件里翻来找去,直接在搜索框输入书名或作者名,结果立刻就出来。
这套“程序采集 + 人工校对 + 在线展示”的组合,是很多高质量开源资源库的典型做法。
为什么值得用?
格式全覆盖,什么设备都能看
项目提供了三种主流格式:
- EPUB:适合大多数电子阅读器,排版灵活,支持字典查词、书签标注
- MOBI:Kindle的传统格式,直接拖进去就能看
- AZW3:也是Kindle的格式,但排版效果更好,字体渲染更细腻
不管你用Kindle、平板、手机还是电脑,都能找到合适的格式。
分类精细,找书不费劲
1000个分类听起来很多,但其实就两类。
按内容分:文学、历史、科普、管理、心理、推理、传记……这是传统图书馆的分类逻辑,按主题去找,很容易定位到自己感兴趣的领域。
按对象分:中国、美国、英国、法国、日本……这是按国家或地区划分,适合想找特定文化背景书籍的读者。
还有更细的,比如“二战”“冷战”“唐朝”“宋朝”——说明这个库里的书不只是泛泛而谈,而是有深度的专题收藏。
来源清晰,书不是瞎找的
项目标注了每本书的来源平台——帆书、微信读书、京东读书、喜马拉雅。这些都是国内主流的知识付费平台,书的质量是有保证的,不是随便从网上抓来的盗版资源。
怎么用?
两种方式。
方式一:在线搜索(推荐)
直接访问项目的GitHub Pages页面:
https://jbiaojerry.github.io/ebook-treasure-chest/
进去之后有一个搜索框,输入书名、作者或分类关键词,结果实时显示。支持多关键词搜索,用空格分隔就行。
方式二:GitHub上翻分类
如果不想搜,也可以直接在GitHub仓库里按分类浏览。每个分类是一个Markdown文件,点进去就能看到该分类下的所有书籍和下载链接。
这个项目适合谁?
- 爱看书但不想在找书上花太多时间的人——搜一下就能下,不用到处翻
- 有Kindle但不知道去哪下书的人——MOBI和AZW3直接适配
- 想拓展阅读面但不知道看什么的人——1000个分类随便翻,总能找到感兴趣的
- 不想在多个读书App之间切换的人——一个项目覆盖了帆书、微信读书、京东读书、喜马拉雅的内容
项目地址:https://github.com/jbiaojerry/ebook-treasure-chest
在线搜索:https://jbiaojerry.github.io/ebook-treasure-chest/
如果觉得有用,也可以去给作者点个Star。毕竟两万多本书的整理和维护,不是一件轻松的事。 有需要的书,建议尽快下载,不知道这个网站能够撑多久。