Markdown/DOCX → PDF
网文小说怎么从 Markdown/DOCX 转成 PDF:先讲清两种格式各自是什么,再说明会丢什么、有哪些坑、长篇的章节与编码要特别注意什么,最后给出该用的工具与自检清单。
Markdown/DOCX 是什么
这里把 Markdown(.md)与 Word 文档(.docx)归为一族,因为它们在转换中的角色相同:都是「带轻量结构的写作源文件」。Markdown 是纯文本加标记符号(# 标题、** 加粗),干净但表达力有限;.docx 是一个 ZIP 包,里面是 Office Open XML,排版信息远比 Markdown 丰富(分页、页眉页脚、批注、修订)。两者都适合作为转换的起点,而不是最终的阅读格式。
.md.docxPDF 是什么
PDF 是 Adobe 提出的固定版式文档格式,它记录的是「在页面某个坐标上画什么」,而不是「这段文字属于哪一段」。因此无论在什么设备上打开,版面都完全一致,适合排版要求严格的场景(合同、论文、扫描件)。代价是它天生不适合重排:正文的换行往往只是视觉换行,抽取出来的文字可能带硬回车、分栏顺序错乱,扫描版更是只有图片、没有文字层。
.pdfMarkdown/DOCX 转 PDF 需要注意什么
先从源格式抽出内容时
.docx 是 ZIP 包里的 Office Open XML,正文在 word/document.xml。其中样式(标题级别)决定章节能否被识别:如果作者用的是「手动加粗的大字」而不是「标题 1」样式,转出的 EPUB 就不会有目录。Markdown 侧则要注意它不支持复杂的表格与嵌套结构。
写进目标格式时
生成 PDF 相当于把内容「拍照定格」:一旦生成就失去重排能力,读者不能调字号、不能换行宽,长文在小屏上体验很差。如果目的是给人长时间阅读,PDF 通常不是好目标;它更适合打印、归档和保版式交付。
两端格式交互带来的坑
- 会失去重排能力:目标格式把版面固定下来,读者无法再调字号或改变行宽。长篇小说转过去之后,在小屏上只能靠缩放阅读,这是最常见的「转完更难读」的原因。若非为了打印或保版式交付,建议保留一个可重排版本作为阅读用副本。
会丢什么
- 字号可调、按屏幕重排的能力
- CSS 排版:字体、字号、颜色、缩进与间距
- 文字的可重排性(PDF 一旦生成版面即固定)
会得到什么
- 版面在任何设备上完全一致,适合打印
转换后自检清单
- 先用前 3 章试转,确认没有丢字、串行或错位,再整本转换。
- 检查章节切分:目录条目数应与实际章数一致。
- 随机翻 5 处,搜索书中一个人名,确认文本可被完整检索。
- 确认插图数量与位置:尤其看图片有没有挤在章节末尾。
- 补全书名、作者、语言;语言标签写错会导致排版(如中文断行)异常。
- 确认页边距与中文字体已内嵌,否则在别人电脑上会显示成方框。
小说转换的特殊之处
小说是最常见、也最特殊的一类电子书:几百上千章、几乎没有图表、常常只有一份 TXT 源文件,中文源还经常带防盗乱码。下面几点是最容易踩、也最影响阅读体验的。
- 目标格式没有目录概念,而长篇阅读最难受的恰恰是「翻不到某一章」。如果这本书你还要长期读下去,建议另存一份带目录的版本(EPUB 或 Kindle),把这个当作分发或归档副本。
- 一部长篇转成固定版式之后,手机上只能靠缩放阅读。小说是所有书里最不适合固定版式的类型 —— 它几乎没有图表、全是连续文字。除非要打印或投稿,长篇一律优先选可重排格式。
- 分卷信息(「第一卷」「第二卷」)在多数转换里会被降级成普通标题,卷与章的层级关系随之丢失。如果你在意层级,转换后到编辑器里把卷标题提升一级,别让它和章标题平级。
Markdown/DOCX 转 PDF 的工具
下面这些工具都能完成这个方向的转换,按你的操作系统和文件数量挑一个即可。动手前建议先看上一节的注意事项 —— 顺序错了(比如该先 OCR 却直接转)往往要重来一遍。
ocrmypdf / Tesseract
免费命令行给扫描版 PDF 加文字层(OCR)的开源方案,支持中文。扫描件在转换前必须先走这一步,否则任何「抽出文字」的转换拿到的都是空白。识别结果需要人工校对错别字。
Stirling PDF
免费在线服务开源的 PDF 工具箱,可在浏览器里完成 PDF 的拆分、合并、旋转、压缩与文本导出,也能自建部署以保证文件不出内网。适合 PDF 侧的操作;转出可重排格式仍建议用 Calibre。
Calibre
免费桌面应用电子书转换的事实标准,免费开源。支持 EPUB、MOBI、AZW3、PDF、TXT、FB2、DOCX、HTML 等几乎所有常见格式互转,能自动生成目录、抓取元数据、批量处理整个书库。缺点是界面偏工具化、PDF 转出效果一般,且转换选项较多需要花点时间理解。
常见问题
Markdown/DOCX 转 PDF 会丢失什么?
字号可调、按屏幕重排的能力;CSS 排版:字体、字号、颜色、缩进与间距;文字的可重排性(PDF 一旦生成版面即固定)。
用什么工具把 Markdown/DOCX 转成 PDF?
推荐 ocrmypdf / Tesseract、Stirling PDF、Calibre。其中 ocrmypdf / Tesseract 最适合这个组合;给扫描版 PDF 加文字层(OCR)的开源方案,支持中文。扫描件在转换前必须先走这一步,否则任何「抽出文字」的转换拿到的都是空白。识别结果需要人工校对错别字。
Markdown/DOCX 转 PDF 需要注意什么?
会失去重排能力:目标格式把版面固定下来,读者无法再调字号或改变行宽。长篇小说转过去之后,在小屏上只能靠缩放阅读,这是最常见的「转完更难读」的原因。若非为了打印或保版式交付,建议保留一个可重排版本作为阅读用副本。
转换完,用什么读?
阅竹 Tide Reader 支持 TXT 与 EPUB,导入即自动识别章节、按你的习惯排版,阅读进度在 Windows、macOS、iOS、Android 之间同步。转换出来的文件直接拖进来就能读。
免费下载阅竹支持 TXT / EPUB;本地阅读优先,可选云同步与 WebDAV。
