PDF 是 AI 工作流里最常被「卡住」的文件格式——它天生为打印设计,不是为机器读取设计。Anthropic 官方出品的 PDF Skill 就是来解决这件事的:让 Claude Code 及兼容 Agent 像人一样处理 PDF 的读、写、改、拆、合、填、加密与 OCR。
能做什么:PDF 全生命周期
这个 Skill 覆盖了 PDF 处理的几乎所有高频场景:
- 读取与提取:从 PDF 中提取文本和表格(pdfplumber 精确提取表格结构),读取元数据(标题/作者/主题)
- 合并与拆分:把多份 PDF 合并成一个文件,或把一份拆成单页/指定页码范围
- 页面操作:旋转页面方向、添加水印、重排页面顺序
- 创建与表单:从零生成 PDF、填充 PDF 表单(FORMS 模块专门处理表单字段)
- 安全:对 PDF 加密与解密,保护敏感文档
- OCR:对扫描件做文字识别,让不可搜索的扫描 PDF 变得可检索
技术底座:Python 生态
Skill 内置了成熟 Python 库的组合:pypdf 负责基础读写与页面操作、pdfplumber 负责高精度文本/表格提取、OCR 走 Tesseract 管线。Agent 拿到任务后会自动选择合适的库组合,无需用户干预。
典型使用场景
- 合同审阅:让 AI 读取一份 50 页合同 PDF,提取关键条款、日期与金额,输出结构化摘要
- 报告整理:把多份周报 PDF 合并成一份月报,再加水印分发
- 表单自动化:批量填充 PDF 表单(如发票、申请单),替代人工录入
- 扫描件数字化:把纸质文档扫描件 OCR 成可搜索文本,接入后续处理管线
使用方法与下载
Claude Code 用户:将 skills/pdf 目录放入项目的 .claude/skills/ 文件夹即可启用;启用后只需用自然语言描述 PDF 任务(「把这个 PDF 转成文本」),Agent 会自动调用。完整代码与使用说明见 GitHub 官方仓库。
其他 Agent 用户:Skill 遵循通用的 SKILL.md 约定(name/description 元数据 + 操作指南),兼容支持 Agent Skills 标准的工具链。官方文档见 Anthropic Agent Skills 文档。
相关资源
文档处理四件套可组合使用:Word 处理 Skill(docx)、Excel 处理 Skill(xlsx)、PPT 处理 Skill(pptx)。若需要通用文档 OCR 能力,可搭配 PaddleOCR 文档解决方案 使用。