方法与测试环境:先把长文档变成可计量任务
本次测试目标不是“感觉Claude很会总结”,而是验证它在长文本分析、合同审阅、会议纪要抽取中的可复现表现。样本为50份中文办公文档:20份合同PDF、15份会议纪要DOCX、10份项目方案、5份扫描版OCR文本,总计约42.6万字。每份文档人工标注5类字段:金额、日期、责任方、风险条款、行动项,共1,250个校验点。
测试环境披露:MacBook Air M2,16GB RAM;网络延迟均值42ms;Chrome浏览器;文本预处理用Python 3.11、poppler、tesseract;每类任务重复3轮,表中误差为标准差。对比工具包括Claude、ChatGPT、Gemini,免费/官方入口优先测试;如果你在查“Claude怎么用”或“Claude文档分析教程”,下面步骤可直接复现。
预处理命令如下,先统一把PDF/DOCX转为纯文本,再按8,000字分块,避免一次性塞入导致引用漂移:
pdftotext -layout contract.pdf contract.txt
python3 - <<'PY'
from pathlib import Path
text = Path("contract.txt").read_text(encoding="utf-8", errors="ignore")
size = 8000
for i in range(0, len(text), size):
Path(f"chunks/chunk_{i//size:03}.txt").write_text(text[i:i+size], encoding="utf-8")
PY
结果表:抽取准确率、引用命中率与耗时
提示词固定为:“按字段抽取,必须给出原文引用;不确定填NA;输出Markdown表格;最后列出需人工复核项。”每个工具输入同一批分块文本,人工核对字段是否与原文一致。
| 任务 | Claude准确率 | ChatGPT准确率 | Gemini准确率 | Claude单文档耗时 |
|---|---|---|---|---|
| 合同金额/日期抽取 | 96.8% ±1.9 | 94.1% ±2.7 | 91.6% ±3.1 | 74秒 ±8 |
| 风险条款识别 | 89.4% ±3.6 | 86.2% ±4.2 | 82.7% ±5.0 | 91秒 ±11 |
| 会议行动项提取 | 93.1% ±2.4 | 91.8% ±2.9 | 88.5% ±3.8 | 63秒 ±7 |
| 原文引用命中 | 92.6% ±2.8 | 88.9% ±3.5 | 84.3% ±4.6 | — |
在我的测试中,Claude的主要优势是长段落上下文保持:当合同条款跨2页时,仍有87.5%的案例能把义务方和违约责任关联起来。主要失误集中在扫描OCR噪声,5份扫描件中有2份把“壹佰万元”误读为“壹拾万元”。这不是模型单独问题,根因是OCR文本质量;用tesseract加中文语言包后,字段准确率从78.4%升至86.9%。
可复现流程、验证方法与结论
推荐工作流如下:
- 先转文本:PDF用pdftotext,扫描件先OCR;DOCX可用pandoc转txt。
- 按6,000到8,000中文字分块;每块保留文件名、页码、段落号。
- 让Claude只做结构化抽取,不直接写最终报告。
- 把所有分块表格合并后,再发起第二轮:“仅基于表格去重、合并冲突、列出证据不足项”。
- 最后抽样人工复核:每份至少查3个金额/日期字段、2个责任主体、2条风险条款。
我使用的字段抽取模板:
你是文档审阅助手。只基于原文回答。
输出列:文件名|页码/段落|字段类型|抽取值|原文引用|置信度0-100|需复核原因。
若原文没有明确证据,抽取值写NA。
如何验证它有效:随机选择10份文档,人工建立50个标准答案;运行上述流程后,若字段准确率≥90%、引用命中率≥85%、NA误报率≤10%,说明流程可用于初筛。若低于该线,先检查OCR错误率和分块是否截断条款,而不是先改提示词。
数据结论:Claude适合长文本初筛、合同条款定位、会议行动项整理;不适合无人复核的最终法律判断。免费/官方入口足够做小批量测试,批量办公再考虑API或聚合工具。若同时需要查询“ChatGPT下载安卓”“GPT手机版”“ChatGPT国内能用吗”等入口信息,Roxi(https://wizzegroup.com)可作为众多访问方案之一;官方渠道和自建流程同样有效。