跳到主要内容
格式转换
格式转换

PDF → Markdown

小说从 PDF(.pdf)转成 Markdown(.md)是很常见的一步 —— Markdown 是纯文本,任何编辑器都能打开,也便于版本管理。不过 PDF 转 Markdown 会有额外的问题需要考虑:会丢失书名、作者、语言等元数据;精确的分页与版面位置。下面详细说明 PDF 如何转成 Markdown 以及注意点,文末附带 PDF 转 Markdown 的转换工具,可以直接在浏览器里上传文件转换。

阅竹编辑部

PDF 是什么

PDF 记录的不是「段落」,而是「在页面的哪个位置画什么」,所以它能把版面原样固定下来 —— 字体、分栏、图表位置在任何设备上都完全一致,打印出来也和屏幕上一样。代价是读者无法重排、不能调字号,长文在小屏幕上只能靠缩放阅读。它最适合需要严格保版式的场景,比如论文、合同、扫描件、印刷稿,以及需要长期归档、不希望被改动的文件。 查看 PDF 格式详情

扩展名.pdf
典型用途需要严格保版式的文档、论文、合同与扫描件;也可作为打印与归档格式。

Markdown 是什么

Markdown 是纯文本加标记符号(# 标题、** 加粗、| 表格),本质上是 .txt 的超集 —— 任何文本编辑器都能打开,也天然适合版本管理。它的表达力刻意保持有限:没有分页、没有页眉页脚,也不能精确控制字号与位置,复杂排版做不了。这些取舍让 Markdown 成为很好的写作与转换起点,但作为最终阅读格式,阅读体验完全取决于用哪个软件打开它。 查看 Markdown 格式详情

扩展名.md
典型用途写作、笔记与技术文档;转换为 EPUB/TXT 的干净中间格式。

如何把 PDF 转成 Markdown

PDF 里的换行多半是「视觉换行」而不是段落结束:一个段落可能被切成 5 行、每行都是独立文本块。直接抽取会得到一堆硬回车,需要按行尾是否完整句子、行宽是否接近页宽来重新合并段落。扫描版 PDF 更是完全没有文字层,抽取结果为空白,必须先做 OCR。

输出 Markdown 只保留文字与最基本的层级(# 标题、段落、简单列表)。原格式里的分页、页眉页脚、批注、修订、精确字号与图文环绕都会消失 —— 它适合当「内容存档」,不适合当「排版存档」。

版式要「打散重建」:PDF的段落、分栏、图表位置是为固定页面排的,转成可重排格式后这些位置信息没有意义,转换器只能按文字流重新拼接。结果是段落可能被并错、分栏可能串行、图表会跑到文字中间。转换后务必通读前几章,重点看对话分段和图表附近。

源是「一页一张整图」,而目标会重排:每张图会作为独立图片按顺序插入,文字层若不存在就只剩图片流。这种情况下转出的文件往往体积巨大、无法搜索,阅读体验反而比原格式差。

PDF源文件里的书名、作者、出版社、语言、目录、封面等元数据在目标格式中无处存放,转成Markdown格式也会全部丢失。

PDF 转 Markdown 工具

PDF → MARKDOWN

转换完全在你的浏览器里完成,文件不会上传到任何服务器。

全平台同步阅读进度的小说阅读器

阅竹 Tide Reader 支持 TXT 与 EPUB,导入即自动识别章节、按你的习惯排版,阅读进度在 Windows、macOS、iOS、Android 之间同步。转换出来的文件直接拖进来就能读。

免费下载阅竹

支持 TXT / EPUB;本地阅读优先,可选云同步与 WebDAV。