# 让非结构化文档，成为数据

启智 qizhi-fde-opc · 开源参考方案

以 Docling 解析文档，再连接检索与审核流程。

## 业务问题
业务资料混合了 PDF、扫描件、表格和图示，手工录入容易遗漏上下文。先建立可核对的解析结果，再让这些信息进入查询与业务流程。

## 适合谁
需要整理技术手册、产品资料和业务文档的知识或数据团队。

## 验证范围与投入
平台：Docling · 文档解析
输入：有代表性的 PDF、表格或扫描件
产物：保留页码线索的结构化文档与待复核字段
前置条件：有文件使用权限，并能人工标注关键字段
验证范围：建议先准备 10 份不同版式的样本，核对关键表格与字段
投入判断：扫描质量、复杂表格与版式差异决定主要校验投入
以上为建议范围，不是报价或工期承诺。

## 样例（未经客户验证）
输入：带表格的产品手册。
预期输出：产品型号、参数表、原文页码及缺失字段标记。
无法稳定解析：保留原件并进入人工复核。

## 实现路径
1. **建立有代表性的文档样本**
   覆盖常见文件格式、表格、复杂版面和低质量扫描件。为关键字段标注人工参考答案。

2. **解析并保留原始上下文**
   用 Docling 将文档转换为结构化表达或 Markdown。保留原文件、页码和版面线索，方便复核。

3. **在下游使用前验证**
   对必填字段、表格行列和文本顺序做校验。把低质量结果分流到人工审核，再接入知识检索。

## 验收检查
- [ ] 关键字段可以回到原文件核对。
- [ ] 表格结构和页间关系在样本中经过人工验证。
- [ ] 解析失败和缺失字段有明确的处理路径。

## 落地边界
- OCR 和布局识别会受扫描质量及语言影响。
- 结构化输出不等于业务含义已经被正确理解。
- 具体支持格式和模型配置以官方文档为准。

## 公开来源
[Docling 官方文档](https://docling-project.github.io/docling/)

以上是依据公开技术资料整理的实践建议，尚未经特定客户项目验证。请结合业务、权限和验收要求使用。
