/parse,或使用 /scrape
抓取公开文档 URL,即可获取 Markdown、逐页内容、逐页类型化布局块或结构化 JSON。
- 感知布局:按阅读顺序组织标题、段落、表格和公式
- 支持扫描件:原生文本提取,并为纯图像页面提供 OCR 回退方案
- 结构可追溯:逐页类型化布局块,包含边界框以及指向 Markdown 中字符范围的链接 (PDF)
- 支持常见格式:PDF、Word、Excel、PowerPoint、OpenDocument、EPUB、CSV、HTML
- 支持 零数据保留
快速入门
如果您有公开文档 URL而非文件,
/scrape
会自动检测文件类型并以相同方式解析——选项和输出均相同:
firecrawl.scrape("https://example.com/report.pdf")。响应
numPages 是实际解析的页数;totalPages 是文档的
实际总页数。除非 maxPages 截断了结果,否则两者会一致——例如,解析
一个 100 页的 PDF 并设置 maxPages: 10 时,会返回 numPages: 10 和 totalPages: 100,因此
totalPages > numPages 表示输出已被截断。无法确定页数时,
则会省略 totalPages。按物理页划分的 Markdown (PDF)
pages: true 后,文档还会包含一个 pages 数组,其中包含按实际页面划分的 markdown——当您需要确认内容来自哪一页,或需要独立处理各页面时非常有用。
无需额外成本。
布局块 (PDF)
blocks: true 后,文档还会
包含一个 blocks 数组:其中按页提供解析引擎检测到的逐页类型化布局块,
以及其几何信息和来源信息。这是 markdown 的结构化对应形式——可用于引用溯源、
高亮叠加层,或审计文档内容。无需额外成本。

引擎检测到的每个封禁均标注了类型和位置——与生成 markdown 的区域相同。
封禁字段
溯源:从答案回溯到页面
markdownSpan 将每个封禁关联到其生成的 markdown 中对应的精确子字符串。这让引用溯源成为查找而非推断:在 markdown 中找到引用的文本,再找到 span 覆盖该偏移位置的封禁,即可获得页码和边界框——完全无需向语言模型查询坐标。
结构化 JSON 输出
PDF 选项
parsers 选项控制,/parse 和
/scrape 均适用:
传入
parsers: [] 将完全跳过解析,并以 base64 格式返回 PDF
(固定消耗 1 个额度) 。
解析模式
支持的格式
.html, .htm, .xhtml, .pdf, .docx, .doc, .docm, .odt, .ods, .odp, .rtf, .xlsx, .xls, .xlsm, .xlsb, .pptx, .ppt, .pptm, .epub, .csv.
请参见Document Parsing,了解各格式的
转换方式。
请求参考
multipart/form-data,其中包含必填的 file 部分和可选的 options JSON 部分。options 接受部分 scrape 选项:
formats:输出格式数组。默认值为["markdown"]。支持:markdown、html、rawHtml、links、images、summary和json(可搭配 schema 或 prompt) 。onlyMainContent:仅返回文档的主体内容。默认值为true。includeTags/excludeTags:按标签包含或排除内容 (适用于 HTML 输入) 。redactPII:对返回的 markdown 中的个人身份识别信息进行脱敏处理。timeout:请求超时时间 (毫秒) 。默认值为30000,最大为300000。parsers:文件解析器控制选项 — 请参见 PDF 选项。
/parse 不支持仅适用于浏览器的选项,例如 actions、waitFor、location、mobile 或变更追踪。注意事项
- 每个请求的最大文件大小为 50 MB。
- PDF 解析按每页 1 个额度计费;
pages和blocks选项不产生额外成本。 - 在
ocr模式下解析超大 PDF 或扫描版 PDF 可能需要更长时间——请增大timeout,或使用maxPages来限定处理范围。 - 对于多份文件,请对每个文件并行调用
/parse;不支持批量上传。
你是需要 Firecrawl API 密钥的 AI 代理吗?请参见 firecrawl.dev/agent-onboarding/SKILL.md 获取自动化引导说明。

