跳到主要内容
格式转换
格式转换

EPUB → HTML

网文小说怎么从 EPUB 转成 HTML:先讲清两种格式各自是什么,再说明会丢什么、有哪些坑、长篇的章节与编码要特别注意什么,最后给出该用的工具与自检清单。

阅竹编辑部约 6 分钟

EPUB 是什么

EPUB 是国际数字出版论坛制定的开放电子书标准,本质是一个 ZIP 压缩包,里面装着 XHTML 正文、CSS 样式、图片和一份定义阅读顺序的 OPF 清单。它最大的特点是「可重排」:正文与排版分离,阅读器会根据屏幕大小和字号重新排版,因此同一个文件在手机、平板、电脑上都能得到合适的版面,是除 Kindle 生态外最通用的电子书格式。

扩展名.epub
典型用途主流电子书分发与长文阅读,适合小说等以文字为主、需要按屏幕重排的书。

HTML 是什么

HTML / XHTML 是网页的结构语言,也是 EPUB 内部真正使用的正文格式;.mhtml(MHTML)则是把网页及其全部资源(图片、CSS)打包成单个文件,常用于「另存为单个网页」。XML 是通用标记语言,FB2、OPF 等格式本身就是一种 XML。这一族本质上都是「带标签的文本」,标签决定结构,所以转成其他格式时保留多少结构,取决于转换工具对标签的理解程度。

扩展名.html.htm.xhtml.xml.mhtml
典型用途网页正文抓取、EPUB 内部正文、以及作为其他格式的通用中间表示。

EPUB 转 HTML 需要注意什么

先从源格式抽出内容时

EPUB 的正文是 XHTML 片段 + 独立的 CSS,抽取时必须同时解析 OPF 清单里的 spine 顺序(阅读顺序)和 toc(目录)。如果只按压缩包里的文件名字典序拼正文,章节顺序会错乱 —— 这是把 EPUB 转成单个 TXT 时最常见的错误。

写进目标格式时

生成 HTML 时,图片与样式是外链还是内嵌决定了它能否单文件分发。要「一个文件带走」,需要把资源内联(data URI)或改用 MHTML;否则移动文件就会丢图。同时保留语义化标签(h1–h6、p),这样后续再转 EPUB 时目录才不会丢。

两端格式交互带来的坑

  • 源文件自带目录结构(章节标记),而目标格式没有目录概念 —— 读的时候只能一路翻。若目标仍需导航,可考虑用「分章后的 TXT + 明确的章标题行」来人工保留可读的分界。
  • 把结构化压缩包压平成一个文本文件时,章节顺序必须按清单文件(spine)而不是压缩包内的文件名字典序来拼接 —— 这是此类转换中最容易出错、且错误最隐蔽的一点:文件能打开,但章节是乱的。

会丢什么

  • 两端结构相近,主要损失是排版细节的细微差异

会得到什么

  • 可用浏览器直接打开、便于嵌入网页

转换后自检清单

  1. 先用前 3 章试转,确认没有丢字、串行或错位,再整本转换。
  2. 随机翻 5 处,搜索书中一个人名,确认文本可被完整检索。
  3. 确认插图数量与位置:尤其看图片有没有挤在章节末尾。
  4. 补全书名、作者、语言;语言标签写错会导致排版(如中文断行)异常。

小说转换的特殊之处

小说是最常见、也最特殊的一类电子书:几百上千章、几乎没有图表、常常只有一份 TXT 源文件,中文源还经常带防盗乱码。下面几点是最容易踩、也最影响阅读体验的。

  • 长篇小说动辄数百上千章,目录质量直接决定这本书能不能用。转换前先把章标题统一成一种可识别的写法(例如都写成「第X章 标题」并独占一行),否则目标格式里的目录会缺章、串章,甚至整本只剩一章。
  • 分卷信息(「第一卷」「第二卷」)在多数转换里会被降级成普通标题,卷与章的层级关系随之丢失。如果你在意层级,转换后到编辑器里把卷标题提升一级,别让它和章标题平级。

EPUB 转 HTML 的工具

下面这些工具都能完成这个方向的转换,按你的操作系统和文件数量挑一个即可。动手前建议先看上一节的注意事项 —— 顺序错了(比如该先 OCR 却直接转)往往要重来一遍。

Pandoc

免费命令行

文档格式转换的瑞士军刀,命令行一条命令完成。Markdown、DOCX、HTML、EPUB 之间的互转质量最高,特别适合「写作源文件 → 电子书」的流程。不支持 MOBI/AZW3,也不处理漫画归档。

平台: Windows / macOS / Linux(命令行)pandoc.org ↗

Calibre

免费桌面应用

电子书转换的事实标准,免费开源。支持 EPUB、MOBI、AZW3、PDF、TXT、FB2、DOCX、HTML 等几乎所有常见格式互转,能自动生成目录、抓取元数据、批量处理整个书库。缺点是界面偏工具化、PDF 转出效果一般,且转换选项较多需要花点时间理解。

平台: Windows / macOS / Linuxcalibre-ebook.com ↗

SumatraPDF

免费阅读器

轻量阅读器,支持 PDF、EPUB、MOBI、CBZ 等,可把 PDF 内容另存为文本。用于「先看看内容能不能正确抽取出来」这一步很快 —— 如果它选中的文字是乱的,转换前就需要先做 OCR。

平台: Windowswww.sumatrapdfreader.org ↗

常见问题

EPUB 转 HTML 会丢失什么?

两端结构相近,主要损失是排版细节的细微差异。

用什么工具把 EPUB 转成 HTML?

推荐 Pandoc、Calibre、SumatraPDF。其中 Pandoc 最适合这个组合;文档格式转换的瑞士军刀,命令行一条命令完成。Markdown、DOCX、HTML、EPUB 之间的互转质量最高,特别适合「写作源文件 → 电子书」的流程。不支持 MOBI/AZW3,也不处理漫画归档。

EPUB 转 HTML 需要注意什么?

源文件自带目录结构(章节标记),而目标格式没有目录概念 —— 读的时候只能一路翻。若目标仍需导航,可考虑用「分章后的 TXT + 明确的章标题行」来人工保留可读的分界。 把结构化压缩包压平成一个文本文件时,章节顺序必须按清单文件(spine)而不是压缩包内的文件名字典序来拼接 —— 这是此类转换中最容易出错、且错误最隐蔽的一点:文件能打开,但章节是乱的。

转换完,用什么读?

阅竹 Tide Reader 支持 TXT 与 EPUB,导入即自动识别章节、按你的习惯排版,阅读进度在 Windows、macOS、iOS、Android 之间同步。转换出来的文件直接拖进来就能读。

免费下载阅竹

支持 TXT / EPUB;本地阅读优先,可选云同步与 WebDAV。