跳到主要内容
格式转换
格式转换

漫画 CBZ/CBR → TXT

网文小说怎么从 漫画 CBZ/CBR 转成 TXT:先讲清两种格式各自是什么,再说明会丢什么、有哪些坑、长篇的章节与编码要特别注意什么,最后给出该用的工具与自检清单。

阅竹编辑部约 6 分钟

漫画 CBZ/CBR 是什么

漫画归档格式(Comic Book Archive)并不是真正的「格式」,而是一组图片按顺序打包:.cbz 就是 ZIP、.cbr 是 RAR、.cbt 是 TAR、.cb7 是 7z,只是改了扩展名以便阅读器识别。它没有文字层、没有字体设置,每一页就是一张整图,靠文件名排序决定阅读顺序(所以 1.jpg、2.jpg…10.jpg 这种不补零的命名会导致「10 排在 1 后面」)。

扩展名.cbr.cbz.cbt.cb7
典型用途漫画、画册与扫描成图片的书籍;本质是图片包,不是文字书。

TXT 是什么

TXT 是纯文本格式,文件里只有字符本身,没有任何字体、字号、颜色、图片或分页信息 —— 换行符是唯一的「结构」。中文网络小说绝大多数以 TXT 流传,原因就是它体积小、任何设备都能打开、易于复制与增量更新。代价是它不携带章节结构、没有封面与元数据,而且编码(UTF-8 / GBK / UTF-16)不一致时会出现乱码,这是 TXT 最常见的两个问题。

扩展名.txt
典型用途中文网络小说、日志与任何需要最大兼容性的纯文字内容。

漫画 CBZ/CBR 转 TXT 需要注意什么

先从源格式抽出内容时

漫画归档是「改名的压缩包」:.cbz=ZIP、.cbr=RAR、.cbt=TAR、.cb7=7z。它没有文字层,而且阅读顺序由文件名排序决定 —— 如果图片没补零(1.jpg、2.jpg…10.jpg),第 10 页会排在第 2 页后面,转换前应先重命名补零。

写进目标格式时

TXT 只能保存字符:所有图片、字体、字号、颜色、表格、脚注、超链接都会消失,章节标题降级为普通文字行。转换时还要选定编码(中文建议 UTF-8,老设备可能要求 GBK),编码选错会直接变成乱码。

两端格式交互带来的坑

  • 版式要「打散重建」:源文件的段落、分栏、图表位置是为固定页面排的,转成可重排格式后这些位置信息没有意义,转换器只能按文字流重新拼接。结果是段落可能被并错、分栏可能串行、图表会跑到文字中间。转换后务必通读前几章,重点看对话分段和图表附近。
  • 源文件**没有文字层**,整页都是图片。这意味着任何以文字为目标的转换都不会凭空产生文本 —— 你得到的要么是空白,要么是图片被当成「一个大字符」插入。要拿到可搜索、可重排的文字,必须先做 OCR(文字识别),而 OCR 对中文小说会引入错别字,需要人工校对。
  • 源是「一页一张整图」,而目标会重排:每张图会作为独立图片按顺序插入,文字层若不存在就只剩图片流。这种情况下转出的文件往往体积巨大、无法搜索,阅读体验反而比原格式差。
  • 源文件里的书名、作者、出版社、语言、封面等元数据在目标格式中无处存放,会全部丢失。若你之后要把转出的文件放回书库,需要靠文件名自己记住这些信息。
  • 源文件没有章节概念(漫画按页、PDF 按页),而目标期望有目录。转换器只能按页或按固定长度机械切分,得到的目录没有语义 —— 如果不需要导航可以忽略,但不要指望它能自动识别出「章」。
  • 把结构化压缩包压平成一个文本文件时,章节顺序必须按清单文件(spine)而不是压缩包内的文件名字典序来拼接 —— 这是此类转换中最容易出错、且错误最隐蔽的一点:文件能打开,但章节是乱的。
  • 涉及 TXT 就要盯住编码:中文 TXT 常见 UTF-8、GBK、GB18030、BIG5,还有带 BOM 与不带 BOM 的区别。写入时选 UTF-8(不带 BOM)兼容性最好;写入 GBK 是为了兼容老设备。编码选错的表现是整篇乱码,而不是报错。
  • 换行符也要统一:Windows 用 CRLF、Unix 用 LF,Mac 老文本曾用 CR。混用会导致某些阅读器把所有文字显示成一行。转换后若发现「整本书挤成一段」,先查换行符。

会丢什么

  • 全部插图、封面与图表
  • 书名、作者、语言等元数据

会得到什么

  • 可重排:能按屏幕与字号自动排版
  • 体积最小、任何设备都能打开

转换后自检清单

  1. 先用前 3 章试转,确认没有丢字、串行或错位,再整本转换。
  2. 检查章节切分:目录条目数应与实际章数一致。
  3. 确认编码与换行符:用 UTF-8(无 BOM),换行统一为 LF 或 CRLF。
  4. 确认页序:图片文件名需补零(001.jpg),否则第 10 页会排在第 2 页后面。

小说转换的特殊之处

小说是最常见、也最特殊的一类电子书:几百上千章、几乎没有图表、常常只有一份 TXT 源文件,中文源还经常带防盗乱码。下面几点是最容易踩、也最影响阅读体验的。

  • 长篇小说动辄数百上千章,目录质量直接决定这本书能不能用。转换前先把章标题统一成一种可识别的写法(例如都写成「第X章 标题」并独占一行),否则目标格式里的目录会缺章、串章,甚至整本只剩一章。
  • 中文网络小说的 TXT 常见三种「乱码」,处理方式完全不同:① 编码不符(把 UTF-8 当 GBK 读)—— 换对编码即可恢复;② 防盗乱码(作者故意替换了部分字符)—— 无法还原,只能换源;③ 全角半角混排或生僻字缺字 —— 属于字体问题。转换前先判断是哪一种,别把第三类当成第一类反复转码。
  • 小说的封面、人物插图和卷首图都会丢失,书库里会显示成一张空白封面。长篇连载尤其常见「每卷一张卷首图」,转换后那个位置只剩一个空行。
  • 分卷信息(「第一卷」「第二卷」)在多数转换里会被降级成普通标题,卷与章的层级关系随之丢失。如果你在意层级,转换后到编辑器里把卷标题提升一级,别让它和章标题平级。

漫画 CBZ/CBR 转 TXT 的工具

下面这些工具都能完成这个方向的转换,按你的操作系统和文件数量挑一个即可。动手前建议先看上一节的注意事项 —— 顺序错了(比如该先 OCR 却直接转)往往要重来一遍。

Kindle Comic Converter

免费桌面应用

专为漫画归档设计的转换器,输入 CBZ/CBR/CB7,输出为适配 Kindle、Kobo 等设备的形式。会自动处理图片缩放、灰阶、跨页拼接与文件名补零 —— 这些用手工做非常繁琐。

平台: Windows / macOS / Linuxgithub.com/ciromattia/kcc ↗

Calibre

免费桌面应用

电子书转换的事实标准,免费开源。支持 EPUB、MOBI、AZW3、PDF、TXT、FB2、DOCX、HTML 等几乎所有常见格式互转,能自动生成目录、抓取元数据、批量处理整个书库。缺点是界面偏工具化、PDF 转出效果一般,且转换选项较多需要花点时间理解。

平台: Windows / macOS / Linuxcalibre-ebook.com ↗

SumatraPDF

免费阅读器

轻量阅读器,支持 PDF、EPUB、MOBI、CBZ 等,可把 PDF 内容另存为文本。用于「先看看内容能不能正确抽取出来」这一步很快 —— 如果它选中的文字是乱的,转换前就需要先做 OCR。

平台: Windowswww.sumatrapdfreader.org ↗

常见问题

漫画 CBZ/CBR 转 TXT 会丢失什么?

全部插图、封面与图表;书名、作者、语言等元数据。

用什么工具把 漫画 CBZ/CBR 转成 TXT?

推荐 Kindle Comic Converter、Calibre、SumatraPDF。其中 Kindle Comic Converter 最适合这个组合;专为漫画归档设计的转换器,输入 CBZ/CBR/CB7,输出为适配 Kindle、Kobo 等设备的形式。会自动处理图片缩放、灰阶、跨页拼接与文件名补零 —— 这些用手工做非常繁琐。

漫画 CBZ/CBR 转 TXT 需要注意什么?

版式要「打散重建」:源文件的段落、分栏、图表位置是为固定页面排的,转成可重排格式后这些位置信息没有意义,转换器只能按文字流重新拼接。结果是段落可能被并错、分栏可能串行、图表会跑到文字中间。转换后务必通读前几章,重点看对话分段和图表附近。 源文件**没有文字层**,整页都是图片。这意味着任何以文字为目标的转换都不会凭空产生文本 —— 你得到的要么是空白,要么是图片被当成「一个大字符」插入。要拿到可搜索、可重排的文字,必须先做 OCR(文字识别),而 OCR 对中文小说会引入错别字,需要人工校对。 源是「一页一张整图」,而目标会重排:每张图会作为独立图片按顺序插入,文字层若不存在就只剩图片流。这种情况下转出的文件往往体积巨大、无法搜索,阅读体验反而比原格式差。 源文件里的书名、作者、出版社、语言、封面等元数据在目标格式中无处存放,会全部丢失。若你之后要把转出的文件放回书库,需要靠文件名自己记住这些信息。 源文件没有章节概念(漫画按页、PDF 按页),而目标期望有目录。转换器只能按页或按固定长度机械切分,得到的目录没有语义 —— 如果不需要导航可以忽略,但不要指望它能自动识别出「章」。 把结构化压缩包压平成一个文本文件时,章节顺序必须按清单文件(spine)而不是压缩包内的文件名字典序来拼接 —— 这是此类转换中最容易出错、且错误最隐蔽的一点:文件能打开,但章节是乱的。 涉及 TXT 就要盯住编码:中文 TXT 常见 UTF-8、GBK、GB18030、BIG5,还有带 BOM 与不带 BOM 的区别。写入时选 UTF-8(不带 BOM)兼容性最好;写入 GBK 是为了兼容老设备。编码选错的表现是整篇乱码,而不是报错。 换行符也要统一:Windows 用 CRLF、Unix 用 LF,Mac 老文本曾用 CR。混用会导致某些阅读器把所有文字显示成一行。转换后若发现「整本书挤成一段」,先查换行符。

转换完,用什么读?

阅竹 Tide Reader 支持 TXT 与 EPUB,导入即自动识别章节、按你的习惯排版,阅读进度在 Windows、macOS、iOS、Android 之间同步。转换出来的文件直接拖进来就能读。

免费下载阅竹

支持 TXT / EPUB;本地阅读优先,可选云同步与 WebDAV。