跳到主要内容
格式转换
格式转换

PDF → MOBI/AZW3

网文小说怎么从 PDF 转成 MOBI/AZW3:先讲清两种格式各自是什么,再说明会丢什么、有哪些坑、长篇的章节与编码要特别注意什么,最后给出该用的工具与自检清单。

阅竹编辑部约 6 分钟

PDF 是什么

PDF 是 Adobe 提出的固定版式文档格式,它记录的是「在页面某个坐标上画什么」,而不是「这段文字属于哪一段」。因此无论在什么设备上打开,版面都完全一致,适合排版要求严格的场景(合同、论文、扫描件)。代价是它天生不适合重排:正文的换行往往只是视觉换行,抽取出来的文字可能带硬回车、分栏顺序错乱,扫描版更是只有图片、没有文字层。

扩展名.pdf
典型用途需要严格保版式的文档、论文、合同与扫描件;也可作为打印与归档格式。

MOBI/AZW3 是什么

Mobipocket(.mobi)是亚马逊收购后长期作为 Kindle 默认投递格式的电子书格式;AZW3(也叫 KF8)是它的后继者,支持更完整的 HTML5/CSS 排版;.azw 是更早的亚马逊自有封装。三者都能重排、都支持目录与元数据,日常可以视为同一个家族。需要注意它们是亚马逊生态的私有格式,且从 2022 年起亚马逊已改用 KFX/EPUB 投递,.mobi 更多是存量文件。

扩展名.mobi.azw3.azw
典型用途Kindle 设备与 Kindle App 阅读;存量电子书库里最常见的私有格式之一。

PDF 转 MOBI/AZW3 需要注意什么

先从源格式抽出内容时

PDF 里的换行多半是「视觉换行」而不是段落结束:一个段落可能被切成 5 行、每行都是独立文本块。直接抽取会得到一堆硬回车,需要按行尾是否完整句子、行宽是否接近页宽来重新合并段落。扫描版 PDF 更是完全没有文字层,抽取结果为空白,必须先做 OCR。

写进目标格式时

生成 .mobi/.azw3 需要用亚马逊的工具链或 Calibre。注意 AZW3 支持较好的 CSS,而老 .mobi 只支持非常有限的排版;如果目标设备较新,转 AZW3(或干脆用 EPUB 投递)效果更好。

两端格式交互带来的坑

  • 版式要「打散重建」:PDF的段落、分栏、图表位置是为固定页面排的,转成可重排格式后这些位置信息没有意义,转换器只能按文字流重新拼接。结果是段落可能被并错、分栏可能串行、图表会跑到文字中间。转换后务必通读前几章,重点看对话分段和图表附近。
  • 源是「一页一张整图」,而目标会重排:每张图会作为独立图片按顺序插入,文字层若不存在就只剩图片流。这种情况下转出的文件往往体积巨大、无法搜索,阅读体验反而比原格式差。
  • 源文件没有章节概念(漫画按页、PDF 按页),而目标期望有目录。转换器只能按页或按固定长度机械切分,得到的目录没有语义 —— 如果不需要导航可以忽略,但不要指望它能自动识别出「章」。

会丢什么

  • 精确的分页与版面位置

会得到什么

  • 可重排:能按屏幕与字号自动排版
  • 真正的目录与章节跳转
  • 主流阅读器与书库的完整支持

转换后自检清单

  1. 先用前 3 章试转,确认没有丢字、串行或错位,再整本转换。
  2. 检查章节切分:目录条目数应与实际章数一致。
  3. 随机翻 5 处,搜索书中一个人名,确认文本可被完整检索。
  4. 确认插图数量与位置:尤其看图片有没有挤在章节末尾。
  5. 补全书名、作者、语言;语言标签写错会导致排版(如中文断行)异常。

小说转换的特殊之处

小说是最常见、也最特殊的一类电子书:几百上千章、几乎没有图表、常常只有一份 TXT 源文件,中文源还经常带防盗乱码。下面几点是最容易踩、也最影响阅读体验的。

  • 长篇小说动辄数百上千章,目录质量直接决定这本书能不能用。转换前先把章标题统一成一种可识别的写法(例如都写成「第X章 标题」并独占一行),否则目标格式里的目录会缺章、串章,甚至整本只剩一章。
  • 分卷信息(「第一卷」「第二卷」)在多数转换里会被降级成普通标题,卷与章的层级关系随之丢失。如果你在意层级,转换后到编辑器里把卷标题提升一级,别让它和章标题平级。

PDF 转 MOBI/AZW3 的工具

下面这些工具都能完成这个方向的转换,按你的操作系统和文件数量挑一个即可。动手前建议先看上一节的注意事项 —— 顺序错了(比如该先 OCR 却直接转)往往要重来一遍。

ocrmypdf / Tesseract

免费命令行

给扫描版 PDF 加文字层(OCR)的开源方案,支持中文。扫描件在转换前必须先走这一步,否则任何「抽出文字」的转换拿到的都是空白。识别结果需要人工校对错别字。

平台: Windows / macOS / Linux(命令行)ocrmypdf.readthedocs.io ↗

Stirling PDF

免费在线服务

开源的 PDF 工具箱,可在浏览器里完成 PDF 的拆分、合并、旋转、压缩与文本导出,也能自建部署以保证文件不出内网。适合 PDF 侧的操作;转出可重排格式仍建议用 Calibre。

平台: 浏览器(可自建)stirlingpdf.io ↗

Kindle Previewer

免费桌面应用

亚马逊官方工具,可把 EPUB/DOCX 转成 AZW3 并预览在真实 Kindle 排版下的效果。是「转完在 Kindle 上到底长什么样」最可靠的验证方式,也避免了自己拼私有容器出错。

平台: Windows / macOSkdp.amazon.com/en_US/help/topic/G202131100 ↗

Calibre

免费桌面应用

电子书转换的事实标准,免费开源。支持 EPUB、MOBI、AZW3、PDF、TXT、FB2、DOCX、HTML 等几乎所有常见格式互转,能自动生成目录、抓取元数据、批量处理整个书库。缺点是界面偏工具化、PDF 转出效果一般,且转换选项较多需要花点时间理解。

平台: Windows / macOS / Linuxcalibre-ebook.com ↗

常见问题

PDF 转 MOBI/AZW3 会丢失什么?

精确的分页与版面位置。

用什么工具把 PDF 转成 MOBI/AZW3?

推荐 ocrmypdf / Tesseract、Stirling PDF、Kindle Previewer、Calibre。其中 ocrmypdf / Tesseract 最适合这个组合;给扫描版 PDF 加文字层(OCR)的开源方案,支持中文。扫描件在转换前必须先走这一步,否则任何「抽出文字」的转换拿到的都是空白。识别结果需要人工校对错别字。

PDF 转 MOBI/AZW3 需要注意什么?

版式要「打散重建」:PDF的段落、分栏、图表位置是为固定页面排的,转成可重排格式后这些位置信息没有意义,转换器只能按文字流重新拼接。结果是段落可能被并错、分栏可能串行、图表会跑到文字中间。转换后务必通读前几章,重点看对话分段和图表附近。 源是「一页一张整图」,而目标会重排:每张图会作为独立图片按顺序插入,文字层若不存在就只剩图片流。这种情况下转出的文件往往体积巨大、无法搜索,阅读体验反而比原格式差。 源文件没有章节概念(漫画按页、PDF 按页),而目标期望有目录。转换器只能按页或按固定长度机械切分,得到的目录没有语义 —— 如果不需要导航可以忽略,但不要指望它能自动识别出「章」。

转换完,用什么读?

阅竹 Tide Reader 支持 TXT 与 EPUB,导入即自动识别章节、按你的习惯排版,阅读进度在 Windows、macOS、iOS、Android 之间同步。转换出来的文件直接拖进来就能读。

免费下载阅竹

支持 TXT / EPUB;本地阅读优先,可选云同步与 WebDAV。