这个工作流做什么?
PDF 页面渲染 → 版面分析(Docling 版面检测模型)→ 段落/表格/图表/公式区域识别 → OCR 增强(扫描件自动降噪)→ Markdown 语法还原(标题层级/列表/表格)→ 元数据提取(标题/作者/目录/参考文献)
系统流程
PDF 页面渲染 → 版面分析(Docling 版面检测模型)→ 段落/表格/图表/公式区域识别 → OCR 增强(扫描件自动降噪)→ Markdown 语法还原(标题层级/列表/表格)→ 元数据提取(标题/作者/目录/参考文献)
管线分解
- Pillow
pillow— Image pre-processing — deskew, denoise, crop and normalise before analysis pdf → image - Docling
docling— Layout-aware document parsing that preserves reading order and tables pdf → markdown - PyPDF
pypdf— PDF text and metadata extraction, page-level splitting pdf → json
工作流信誉评分
基于执行次数、成功率、更新频率、组件质量和用户评分。
67总分
★★★★★
基于执行次数、成功率、更新频率、组件质量和用户评分。
使用组件
Pillowpillow
Image pre-processing — deskew, denoise, crop and normalise before analysis
python-pillow/Pillow ↗Doclingdocling
Layout-aware document parsing that preserves reading order and tables
DS4SD/docling ↗与 n8n / Zapier 有什么不同?
与通用工作流构建器不同,FlowSync 工作流在每个节点中预置了 AI 能力——OCR、LLM 推理、转录、超分辨率——不仅仅是 webhook 触发器。每个节点都白盒可审计:你能看到输入、输出和配置。部署即时——无需自托管,无需逐节点配置 API 密钥。
使用场景
- 论文批量入库 RAG 系统
- 法律合同全文检索
- 技术文档知识库建设
- 政府报告结构化归档
作者与来源
用户评价
每天读 5 篇论文,Scholarcy 一年 $120。这个免费版效果一样,Markdown 质量极高。
几百页行业报告 1 分钟转 Markdown,进知识库做 RAG 检索。效果惊艳。
数据处理
PDF 仅在服务端内存中解析,不落盘存储。生成的 Markdown 由您决定是否保存。我们不会查看或使用您的文档内容。
FlowSync 工作流市场 · 67 分信誉评分 · 25% 执行率 · 93% 成功率 · 3 节点白盒管线 · FlowSync Official 维护
准备好运行了吗?
版面感知的 PDF 转换,保留阅读顺序、表格和标题——为你的知识管线提供干净的 RAG 摄取层。