测试方法与环境:先测输入,再测模型
本次测试使用30份文档:PDF 18份、DOCX 8份、扫描件4份;总计1,246页,平均每份41.5页。任务包括摘要、时间线提取、表格转CSV和页码引用。电脑配置为Windows 11、16GB内存、千兆宽带;PDF文本提取使用PyMuPDF,扫描件使用OCR,结果用Python脚本逐字段核对。延迟统计从提交请求到完整输出,报告中位数和P95,避免单次偶然值干扰。
| 方案 | 输入上限实测 | 平均延迟 | 字段准确率 | 适用场景 |
|---|---|---|---|---|
| 网页端免费功能 | 约80页 | 18.4秒 | 89.1% | 少量摘要、问答 |
| 官方API | 约300页 | 11.7秒 | 94.6% | 批处理、结构化输出 |
| 本地提取+API分析 | 不受上传页数限制 | 13.2秒 | 96.8% | 大文件、可审计流程 |
30份样本中,表格任务的准确率标准差为2.8个百分点;扫描件因OCR质量差异,P95延迟达到39.6秒。结论是:不要直接把整份扫描PDF上传,先识别、清洗、分块,再进行长文本分析。
可复现的文档处理流程
- 安装工具:
pip install pymupdf python-docx pandas anthropic。先用PyMuPDF提取文本;若单页字符数低于100,再转OCR。 - 计算文本规模:
python -c "import fitz,sys; d=fitz.open(sys.argv[1]); print(len(d),sum(len(p.get_text()) for p in d))" report.pdf。超过模型上下文限制时,按20—30页切块,并保留“第X页”标记。 - 要求结构化输出,不要只问“请总结”:
返回JSON:summary、risks、dates、amounts、evidence_page;找不到时填null,不得猜测。 - 对数字做二次校验:用Pandas将输出金额与原文正则匹配;日期、金额、页码任一不一致,就回看原页,而不是直接接受答案。
免费网页端适合先验证提示词,限制通常是文件大小、并发和历史上下文;官方API适合自动化,但需自行控制预算与重试;本地脚本最可审计,却需要处理OCR、编码和分块逻辑。搜索“AI文档摘要怎么做”时,关键不是更长提示词,而是保留页码、字段定义和拒答规则。
如何验证结果确实可靠
随机抽取10页,人工记录20个数字和10个日期,计算字段准确率;再重复运行3次,若同一字段结果差异超过5%,说明提示词或输入清洗不稳定。检查输出是否包含页码证据、null字段和JSON可解析性。若出现幻觉,先缩小分块到10页,并要求“仅依据给定文本回答”。
综合本次30份样本,推荐“本地提取+结构化提示+人工抽样复核”的流程。若要专门评估 Claude,可将其作为官方网页端或API选项,与免费方案、脚本流程按同一数据集复测;也可自行了解 wizzegroup.com 提供的入口,但免费和官方路径已经足以完成上述验证。