小说下载器使用指南:三步把小说网站存成TXT和EPUB
【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader
追了三年的连载,某天早上打开书页,迎接你的却是刺眼的"404"——这种经历,老书虫多少都遇过一两次。网站改版、章节被锁、整站关停,网络小说消失的速度,常常比更新还快。小说下载器(novel-downloader)就是为这个时刻准备的浏览器脚本:它支持两百多个小说网站,能把目录页一键打包成 TXT 和 EPUB,让看过的故事真正留在你的硬盘里。
一句话总结它的定位:一个可扩展的通用型小说下载器,装进浏览器脚本管理器就能用。它和普通下载脚本最大的区别有两处——一是按"站"适配,两百多个站点各有一份独立解析规则,某个站挂了不影响其他站;二是对反爬有完整对策,连"把文字换成图片"这种招数,它都有对应的解码方案。
每个网站一份规则,这就是它"通用"的秘密
打开项目源码,src/rules/目录按网站形态分门别类:
onePage/:一页展示全部章节的站点twoPage/:目录与正文分页的站点special/:起点、晋江、番茄这类需要特殊处理的站点biquge/、mbtxt/:笔趣阁系等常见转载站
每个站点对应一个规则文件,继承统一基类,实现"解析目录"和"解析正文"两个方法就够了。这意味着新增一个网站的支持,往往只是一份几十行的规则文件,主流程完全不用动。对普通读者来说,这个设计带来的好处很实在:那些小众冷门的站点,很可能早有人贡献过规则,打开就能用。
最硬核的地方:给"图片文字"解码
有些站点(比如西瓜书屋)为了防抓取,把正文里的汉字替换成一张张图片,普通下载器到这里就卡壳了。小说下载器的解法是三层递进:
- 文件名映射:图片文件名直接对应文字,命中率最高、速度最快;
- 哈希映射:文件名对不上,就下载图片算哈希值,再去映射表里匹配;
- OCR 识别:前两招都失效时,调用 PaddleOCR 模型直接读图,最准但也最慢。
前两层够快够准,OCR 只是兜底。首次触发 OCR 时会自动下载识别模型并缓存到本地,之后无需重复加载。
下载运行时,控制台会实时打印每一章的抓取日志,进度一目了然。
从零到第一本书:只需要三步
第一步,装脚本管理器。Tampermonkey、Violentmonkey 任选其一,在浏览器扩展商店搜名字安装即可。
第二步,添加脚本。从脚本发布页把小说下载器装进管理器。首次运行会询问是否同意把当前书页存档到互联网档案馆——这是项目所属"404小说文库"的附加功能,不同意也不影响下载。
第三步,打开目录页,点图标。访问任意一个支持的小说网站目录页,比如番茄、七猫或某个笔趣阁系站点,等右上角出现下载图标,点下去,剩下的交给脚本:
- 下载期间会播放无声音频,这是为了不让浏览器后台休眠,属正常现象;
- 右下角有实时进度条,也可以按 F12 看详细状态;
- 完成后自动存下 TXT 和 EPUB 两份文件,外加一个打包了 HTML 章节的压缩包,方便日后对照。
在目录页点一下右上角的下载图标,接下来只需等待。
下载完成的正文干净整齐,TXT 和 EPUB 都能直接开读。
进阶玩法:只下载你真正需要的那部分
整本上千章,很多时候你只要其中一部分。按下 F12,在控制台里定义这样一个函数,下载时就会自动过滤:
// 只下载前 100 章 function chapterFilter(chapter) { return chapter.chapterNumber <= 100; } window.chapterFilter = chapterFilter;想按卷下载,把条件换成chapter.sectionNumber === 1;想按关键词筛选,就判断chapter.chapterName.includes("武器")。另一个变量saveOptions则能自定义章节标题格式、段落缩进、清除 EPUB 空行,甚至把章节倒序保存。这些能力在官方文档里都有完整示例,属于"需要时再查"的类型,不影响日常使用。
配合自定义保存参数,导出的文本可以完全按你的排版习惯生成。
老用户踩过的坑,帮你提前避一避
- 付费章节不是免费午餐。下载 VIP 章节前,请先在对应网站登录并确认已购买,未购买的付费章节会被直接跳过。
- 长佩文学会限速。它反爬严格,大约每分钟只能下 6 章,别同时开多个页面下多本书。
- 图片型站点首次下载偏慢。触发 OCR 时要先下载识别模型,第一次请多给点耐心。
- 下载卡住先开调试模式。在设置里启用调试后,生成的压缩包会附带
debug.log,连同复现步骤一起反馈,维护者才能定位问题。 - 晋江字体乱码可以修。下载文本若出现异常字符,按日志提示更新字体匹配表即可。
写在最后
小说下载器最难得的地方,是把"保存"这件事做得体面——TXT、EPUB、HTML 三份备份,图片型反爬也有三层解码兜底。它脱胎于"404小说文库"项目,初衷就是保存那些质量上乘、却可能悄然消失的作品。想深入研究的读者,也可以把仓库克隆到本地(git clone https://gitcode.com/gh_mirrors/no/novel-downloader),照着文档跑一次构建,甚至为自己常看的站点贡献一份规则。
当然,也请记住一条朴素的原则:工具负责保存,我们负责尊重版权。只下载已购或公开的内容,别给目标站点造成访问压力。
你的书架上,总该有几本"跑不掉"的小说。
【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考