处理流程
六步把原始来源整理成可用结构
以下为静态流程说明。每一步都写明输入、系统处理、输出和可能的质量警告,处理在不确定时倾向保留证据而不是强行猜测。
来源识别
确认文件类型、编码和页数或结构,决定后续处理方式。
- 输入
- 原始来源文件,例如 PDF、DOCX、Markdown、TXT 或网页正文。
- 系统处理
- 识别文件类型
- 检测文本编码
- 读取页数或整体结构
- 输出
- 带类型、编码和结构信息的来源描述记录。
- 可能的质量警告
- 文件损坏、编码不明或页面结构异常时,标记来源风险并停止猜测。
内容提取
从来源中提取正文、标题、表格和列表等原始内容单元。
- 输入
- 第一步确认过类型和结构的来源文件。
- 系统处理
- 提取正文文本
- 提取候选标题
- 提取表格与列表区域
- 输出
- 按出现顺序排列的原始内容单元序列。
- 可能的质量警告
- 对无法可靠提取的区域记录位置和原因,不伪造缺失内容。
结构恢复
恢复标题层级、段落关系和表格边界,重建文档骨架。
- 输入
- 第二步输出的原始内容单元序列。
- 系统处理
- 推断标题层级
- 合并被拆散的段落
- 确定表格边界
- 输出
- 带层级关系的章节树与段落、表格结构。
- 可能的质量警告
- 层级证据不足时保留原始顺序并给出结构置信提示,不强行归级。
噪声清理
清理页眉页脚、重复段落和异常空白,保留有效内容。
- 输入
- 第三步输出的结构化内容。
- 系统处理
- 识别并移除页眉页脚
- 折叠重复段落
- 规整异常空白
- 输出
- 去除噪声后的干净结构化内容。
- 可能的质量警告
- 疑似正文的重复内容不直接删除,标记后交由人工确认。
元数据补全
补齐来源名、页码、章节路径和处理时间等溯源信息。
- 输入
- 第四步输出的干净结构化内容。
- 系统处理
- 关联来源文件名
- 标注页码范围
- 生成章节路径
- 记录处理时间
- 输出
- 每个内容块都带来源线索的可溯源内容集。
- 可能的质量警告
- 页码或章节无法确定时记录为未知,不填入估计值。
输出与检查
生成 Markdown、JSON 和 chunks manifest,并汇总质量警告。
- 输入
- 第五步输出的可溯源内容集。
- 系统处理
- 渲染 Markdown 文稿
- 序列化结构化 JSON
- 生成 chunks manifest
- 汇总质量警告
- 输出
- document.md、document.json、chunks.json 与质量警告清单。
- 可能的质量警告
- 存在未解决警告时在输出中显式保留,不默认视为通过。