跳到主要内容
格式转换
格式转换

HTML → 漫画 CBZ/CBR

网文小说怎么从 HTML 转成 漫画 CBZ/CBR:先讲清两种格式各自是什么,再说明会丢什么、有哪些坑、长篇的章节与编码要特别注意什么,最后给出该用的工具与自检清单。

阅竹编辑部约 6 分钟

HTML 是什么

HTML / XHTML 是网页的结构语言,也是 EPUB 内部真正使用的正文格式;.mhtml(MHTML)则是把网页及其全部资源(图片、CSS)打包成单个文件,常用于「另存为单个网页」。XML 是通用标记语言,FB2、OPF 等格式本身就是一种 XML。这一族本质上都是「带标签的文本」,标签决定结构,所以转成其他格式时保留多少结构,取决于转换工具对标签的理解程度。

扩展名.html.htm.xhtml.xml.mhtml
典型用途网页正文抓取、EPUB 内部正文、以及作为其他格式的通用中间表示。

漫画 CBZ/CBR 是什么

漫画归档格式(Comic Book Archive)并不是真正的「格式」,而是一组图片按顺序打包:.cbz 就是 ZIP、.cbr 是 RAR、.cbt 是 TAR、.cb7 是 7z,只是改了扩展名以便阅读器识别。它没有文字层、没有字体设置,每一页就是一张整图,靠文件名排序决定阅读顺序(所以 1.jpg、2.jpg…10.jpg 这种不补零的命名会导致「10 排在 1 后面」)。

扩展名.cbr.cbz.cbt.cb7
典型用途漫画、画册与扫描成图片的书籍;本质是图片包,不是文字书。

HTML 转 漫画 CBZ/CBR 需要注意什么

先从源格式抽出内容时

HTML 的结构全在标签里,但真实网页混杂导航、广告、页脚等噪声,直接整页转换会把它们一起带进去。建议先用可读性算法(如 Readability)抽出正文容器,并注意 <img> 多为外链 —— 转成单文件格式前必须把图片下载并内嵌。

写进目标格式时

转成漫画归档实际上只是「把图片打包并按页序命名」,文字内容会被完全丢弃。务必用补零的文件名(001.jpg、002.jpg)保证排序,并注意 .cbr 需要 RAR 工具,而多数阅读器对 .cbz(ZIP)支持最好。

两端格式交互带来的坑

  • 会失去重排能力:目标格式把版面固定下来,读者无法再调字号或改变行宽。长篇小说转过去之后,在小屏上只能靠缩放阅读,这是最常见的「转完更难读」的原因。若非为了打印或保版式交付,建议保留一个可重排版本作为阅读用副本。
  • 目标格式只有图片、没有文字:源文件里的全部文字内容都会被丢弃(或仅以图片形式保留)。如果你的目的是「让内容能被搜索、复制、朗读」,这个方向是错的,应该改选保留文字层的目标格式。
  • 从单个文本文件变成有目录结构的压缩包,是信息「增加」的方向:工具需要替你生成清单文件、目录页与元数据。这些生成物的质量(章节切分是否准确、语言标注是否正确)直接决定成品好不好用。

会丢什么

  • 字号可调、按屏幕重排的能力
  • 可搜索、可复制的文字层
  • CSS 排版:字体、字号、颜色、缩进与间距

会得到什么

  • 按页浏览的图片包,漫画阅读器可整页翻

转换后自检清单

  1. 先用前 3 章试转,确认没有丢字、串行或错位,再整本转换。
  2. 检查章节切分:目录条目数应与实际章数一致。
  3. 确认插图数量与位置:尤其看图片有没有挤在章节末尾。
  4. 补全书名、作者、语言;语言标签写错会导致排版(如中文断行)异常。

小说转换的特殊之处

小说是最常见、也最特殊的一类电子书:几百上千章、几乎没有图表、常常只有一份 TXT 源文件,中文源还经常带防盗乱码。下面几点是最容易踩、也最影响阅读体验的。

  • 目标格式没有目录概念,而长篇阅读最难受的恰恰是「翻不到某一章」。如果这本书你还要长期读下去,建议另存一份带目录的版本(EPUB 或 Kindle),把这个当作分发或归档副本。
  • 一部长篇转成固定版式之后,手机上只能靠缩放阅读。小说是所有书里最不适合固定版式的类型 —— 它几乎没有图表、全是连续文字。除非要打印或投稿,长篇一律优先选可重排格式。
  • 分卷信息(「第一卷」「第二卷」)在多数转换里会被降级成普通标题,卷与章的层级关系随之丢失。如果你在意层级,转换后到编辑器里把卷标题提升一级,别让它和章标题平级。

HTML 转 漫画 CBZ/CBR 的工具

下面这些工具都能完成这个方向的转换,按你的操作系统和文件数量挑一个即可。动手前建议先看上一节的注意事项 —— 顺序错了(比如该先 OCR 却直接转)往往要重来一遍。

Kindle Comic Converter

免费桌面应用

专为漫画归档设计的转换器,输入 CBZ/CBR/CB7,输出为适配 Kindle、Kobo 等设备的形式。会自动处理图片缩放、灰阶、跨页拼接与文件名补零 —— 这些用手工做非常繁琐。

平台: Windows / macOS / Linuxgithub.com/ciromattia/kcc ↗

Calibre

免费桌面应用

电子书转换的事实标准,免费开源。支持 EPUB、MOBI、AZW3、PDF、TXT、FB2、DOCX、HTML 等几乎所有常见格式互转,能自动生成目录、抓取元数据、批量处理整个书库。缺点是界面偏工具化、PDF 转出效果一般,且转换选项较多需要花点时间理解。

平台: Windows / macOS / Linuxcalibre-ebook.com ↗

SumatraPDF

免费阅读器

轻量阅读器,支持 PDF、EPUB、MOBI、CBZ 等,可把 PDF 内容另存为文本。用于「先看看内容能不能正确抽取出来」这一步很快 —— 如果它选中的文字是乱的,转换前就需要先做 OCR。

平台: Windowswww.sumatrapdfreader.org ↗

常见问题

HTML 转 漫画 CBZ/CBR 会丢失什么?

字号可调、按屏幕重排的能力;可搜索、可复制的文字层;CSS 排版:字体、字号、颜色、缩进与间距。

用什么工具把 HTML 转成 漫画 CBZ/CBR?

推荐 Kindle Comic Converter、Calibre、SumatraPDF。其中 Kindle Comic Converter 最适合这个组合;专为漫画归档设计的转换器,输入 CBZ/CBR/CB7,输出为适配 Kindle、Kobo 等设备的形式。会自动处理图片缩放、灰阶、跨页拼接与文件名补零 —— 这些用手工做非常繁琐。

HTML 转 漫画 CBZ/CBR 需要注意什么?

会失去重排能力:目标格式把版面固定下来,读者无法再调字号或改变行宽。长篇小说转过去之后,在小屏上只能靠缩放阅读,这是最常见的「转完更难读」的原因。若非为了打印或保版式交付,建议保留一个可重排版本作为阅读用副本。 目标格式只有图片、没有文字:源文件里的全部文字内容都会被丢弃(或仅以图片形式保留)。如果你的目的是「让内容能被搜索、复制、朗读」,这个方向是错的,应该改选保留文字层的目标格式。 从单个文本文件变成有目录结构的压缩包,是信息「增加」的方向:工具需要替你生成清单文件、目录页与元数据。这些生成物的质量(章节切分是否准确、语言标注是否正确)直接决定成品好不好用。

转换完,用什么读?

阅竹 Tide Reader 支持 TXT 与 EPUB,导入即自动识别章节、按你的习惯排版,阅读进度在 Windows、macOS、iOS、Android 之间同步。转换出来的文件直接拖进来就能读。

免费下载阅竹

支持 TXT / EPUB;本地阅读优先,可选云同步与 WebDAV。