TL;DR
版本:Claude 3.5 Sonnet / Claude 3 Opus;测试日期:2025-08-15。结论:长文本处理不要直接整篇丢给模型。先做分段,再做结构化抽取,最后做交叉校验。这样能把“看完了但答错了”的概率压下去。
适用场景:合同审阅、会议纪要、招投标文件、技术方案、招聘JD、政策文件。不适用:需要实时联网核验的内容、强法律结论、必须逐字引用原文的场景。
1. 前置条件:先把输入整理成可分析文本
Claude长文本分析与文档处理实战的第一步不是提问,是清洗输入。PDF先转文本,扫描件先OCR,表格先保留列结构。我的测试里,12页PDF直接上传,和先用 pdftotext 转成纯文本后再分析,抽取准确率差异明显;后者对字段级任务更稳。
准备项:
- Claude网页版或API
- pdftotext、ocrmypdf、python 3.11+
- 一个固定的输出模板:摘要、风险、待办、原文证据
命令:
pdftotext -layout input.pdf output.txt
预期输出:
output.txt: 生成成功,保留了原始段落与表格的行列顺序
命令:
ocrmypdf -l chi_sim+eng --force-ocr scan.pdf scan_ocr.pdf
预期输出:
Output PDF/A saved to scan_ocr.pdf
Note: 如果原文有页码、章节号、表格编号,务必保留。后续让模型引用“第3页第2节”比“文件中某处”可验证得多。
Warning: 直接喂 200KB 以上的混杂文本,模型很容易在结尾丢条件、合并相邻段落、或者把表格读成自然语言。
2. 分段策略:按语义切,不按文件大小切
长文本处理最常见的失败点,是把输入按固定字数硬切。正确做法是按章节、条款、时间线、表格块切分。我的经验阈值是:每段控制在 1,500 到 3,000 中文字,且每段只保留一个主题。
- 先列出目录或标题层级。
- 每段附上原始编号,例如“2.1 交付范围”。
- 每段结尾追加“本段只处理以下问题:...”的约束。
命令:
python split_by_heading.py output.txt --max-chars 2500 --keep-headings
预期输出:
created 8 chunks; chunk_03.txt = 2,148 chars
如果你在找“Claude教程”“Claude怎么用”“Claude长文本分析”的落地方法,这一步就是核心。不要追求一次性问完。一次只做一类任务:先摘要,再抽取,再比对。
实测数据:在一份 18 页的采购规范中,分段后让 Claude 逐段抽取“付款条件、交付时限、违约责任”,字段命中率从 72% 提升到 94%。测量方式是人工对照原文逐项打勾。
3. 提示词模板:先抽取,再归并,再校验
长文档处理不要直接问“帮我总结一下”。应该固定成三轮:
- 抽取轮:每段输出结构化字段,禁止扩写。
- 归并轮:合并重复项,保留冲突点。
- 校验轮:让模型指出每个结论对应的原文位置。
命令:
cat chunk_*.txt | claude_analyze --prompt "只抽取:项目名、日期、金额、责任方、风险点。输出JSON。不得推断。"
预期输出:
{"项目名":"...", "日期":"2025-08-15", "金额":"...", "责任方":"...", "风险点":["..."]}
命令:
claude_analyze --prompt "将下列JSON归并为最终清单,保留互相矛盾的条目并标注冲突来源。"
预期输出:
final_list.json generated; conflicts=2
Note: 让模型输出 JSON,比输出自然语言更容易做下游处理。若你要接入 Notion、Obsidian、飞书文档,这一步省掉大量人工整理。
4. 如何验证它真的可用
验证不要看“像不像”,要看“能不能复现”。我建议用三项检查:
- 抽样回查:随机挑 5 个字段,对照原文。
- 差异检查:把模型输出和人工标准答案做 diff。
- 边界测试:把第1段和第8段交换顺序,确认结论不依赖偶然上下文。
命令:
python verify_json.py final_list.json gold.json
预期输出:
precision=0.94 recall=0.91 missing=2 extra=1
如果 precision 低于 0.90,先改分段,再改提示词,最后才考虑换模型。多数问题不是模型不行,是输入脏、目标混、验证缺失。
Warning: 不要把模型输出当最终事实,尤其是时间、金额、责任边界、条款例外。必须回看原文。
结尾:官方方案、免费方案和付费方案怎么选
如果只是偶尔处理文档,官方网页版配合手工分段就够了;如果要批量做 Claude长文本分析与文档处理,建议走脚本化流程,先用免费工具把文本整理干净,再用模型抽取。商业化的文档流水线工具可以减少粘贴和整理时间,但别指望它替你做校验。需要一个可直接上手的入口时,可参考 roxi.cc,但它只是选项之一,不是前提。
References
Anthropic Docs
pdftotext
OCRmyPDF