简介与亮点
不是简单抽文字,而是把 PDF 的版面结构还原成干净的 Markdown,并做成「左 PDF 原文 / 右 Markdown 结果」双栏同步阅读器。
- 结构化解析:标题层级、正文、图片、表格、数学公式(LaTeX)一并还原,不是一坨纯文本
- 双栏同步滚动:左翻 PDF、右 Markdown 自动跟到对应位置(按内容匹配,非按页数硬对齐)
- 三种视图:渲染预览 / Markdown 源码 / JSON 版面数据,随时切换
- 三种解析后端:从"快"到"最强"按需选,GPU 加速
- 完全离线:模型已内置,无需联网下载;解析全程不上传任何文件
- 开箱即用:绿色版解压即用,模型、运行环境全部内置
一 安装
绿色版免安装:解压后进入 PDF2Markdown/ 文件夹,双击 PDF转Markdown.exe 即用。
D:\PDF2Markdown)。_internal / runtime / models 等文件夹勿删。硬件要求
- 系统:Windows 10 / 11 64 位
- 显卡:NVIDIA 显卡,要求 CUDA 12.8 及以上(RTX 30 / 40 / 50 全系);显存 pipeline 后端 4 GB 以上即可,hybrid / VLM 后端建议 ≥ 8 GB
- 无独显 / CPU 也能跑:未检测到可用 GPU 时自动切 CPU(慢不少)
- 驱动:NVIDIA 驱动 ≥ 570;内存:建议 16 GB+;硬盘:约 9 GB(含模型),预留 15 GB + SSD
二 激活
本软件需激活后使用(无试用期)。
- 启动软件,点右上角「授权」(灰点 = 未激活)
- 弹窗显示本机机器码(形如
XXXX-XXXX-XXXX-XXXX),点「复制」发给卖家换激活码 - 把激活码粘进输入框,点「激活」,提示「激活成功」即可(右上角变绿点)
三 界面总览
顶部工具栏(从左到右)
| 元素 | 作用 |
|---|---|
| 📂 打开 PDF | 选择本地 PDF(也可把 PDF 直接拖进窗口) |
| ▶ 开始解析 | 对当前 PDF 启动解析 |
| 后端 | pipeline / hybrid / VLM 三选一(见参数一节) |
| 质量 | 仅 hybrid 后端可选 medium / high |
| 设备 | 自动 / GPU / CPU |
| 导出 ▾ | 打开输出目录 / 复制 Markdown / 另存 .md / 另存 .json |
| 🌓 / 授权 | 明暗主题切换 / 激活状态(绿点 = 已激活) |
三栏区域:左 = 页面缩略图(点击跳页,图 / 表页带 FIG / TBL 角标);中 = PDF 原文(渲染);右 = 解析结果,右上角切 预览 / Markdown / JSON 三视图。底部状态栏显示:就绪状态 · 后端 · 设备 · 当前页 · 图 / 表 / 公式统计。
四 使用流程
- 把 PDF 拖进窗口,或点「打开 PDF」(拖入后左侧立即渲染 PDF 与缩略图,无需等解析)
- 选后端(不确定就用默认 pipeline)与设备(默认「自动」)
- 点「开始解析」,中间弹进度遮罩,实时显示解析日志与已用时
- 解析完成,右侧显示 Markdown(含图片、表格、公式渲染)
- 双栏对照阅读:鼠标在哪一栏滚动,另一栏自动同步到对应内容
- 需要时点「导出」:打开输出目录 / 复制 Markdown / 另存 .md / .json(结果也会自动存到本地,含 .md、版面 .json、切出的图片)
五 图片 OCR(不只 PDF)
除 PDF 外,照片、截图、扫描件,甚至手写稿也能识别成文字与 Markdown——排版、分段自动还原,不用一个字一个字敲。
- 印刷体 / 手写体都能识别
- 照片 / 截图 / 扫描件通吃
- 识别结果同样双栏对照、一键导出
六 参数说明
解析后端(工具栏「后端」)
| 后端 | 说明 | 建议 |
|---|---|---|
| pipeline | 传统流水线(版面 + OCR + 表格 + 公式),快、稳、省显存 | 默认首选,覆盖大多数文档 |
| hybrid | 在 pipeline 基础上用视觉大模型(VLM)复查,精度更高 | 复杂 / 难识别版面;可选质量 medium / high |
| VLM | 纯视觉大模型解析,最强但最慢、最吃显存 | 追求极致效果、显存充足时 |
设备(工具栏「设备」)
- 自动:有可用 GPU 就用 GPU,否则 CPU(推荐)
- GPU:强制用 GPU · CPU:强制用 CPU(无显卡或显存不足时)
视图切换(右栏右上角)
- 预览:渲染后的 Markdown(图 / 表 / 公式已排版)
- Markdown:md 源码(可复制) · JSON:版面结构数据(含每个元素的类型 / 位置)
七 常见问题
解析失败 / 显存不足(CUDA out of memory)
把「设备」切到 CPU,或换更省显存的 pipeline 后端后重试。
提示"需要激活后才能使用"
点右上角「授权」,把机器码发卖家换激活码后激活(激活需联网)。
这个 PDF 打不开 / 解析报错
可能是加密 PDF(先去密码)或文件损坏;也可尝试切换后端后重试。
解析很慢
首次解析会加载模型(稍慢),之后变快;CPU 模式本就慢,有 N 卡请用 GPU;hybrid / VLM 比 pipeline 慢很多,追求速度用 pipeline。
右侧 Markdown 和左侧 PDF 对不齐
同步按内容匹配,绝大多数位置精准;参考文献等特殊版面可能有少量偏差,属正常。
需要联网吗?
解析完全离线(模型已内置);只有激活那一次需要联网。
软件双击没反应 / 无法启动
确认 runtime、models、web 等文件夹完整未被杀毒误删;路径尽量英文;试管理员权限运行。
联系方式
购买 / 激活 / 售后,欢迎联系:
- 微信:
yooooloooov8 - QQ:
3091184072 - QQ 群:
1075669841(问题群互助、更新通知,推荐加)