结构化数据提取

把混乱网页转换成结构化数据的 Extract API

告诉 API 你需要哪些字段,提供 JSON Schema,就能获得适合应用直接使用的干净数据。

接口
POST https://api.search1api.com/extract
这个 API 能帮你拿到什么

告诉 API 你的产品需要什么信息,把非结构化网页变成干净的业务数据。

1
可直接用于业务的字段

价格、评分、实体和自定义字段。

2
比选择器更不容易坏

用自然语言描述提取规则。

3
应用可以直接保存的数据

应用可保存的结构化数据。

适合用于

商品目录 / 公司数据 / 文章记录

带 schema 控制的提示词提取

Extract API 结合网页理解和 JSON Schema 输出。它适合处理简单爬虫容易失效的场景,例如商品信息、体育比分、公司数据或文章元数据。

结构化提取

使用自然语言提示从任何网页中提取特定的结构化数据。

JSON Schema 输出

使用 JSON Schema 定义所需的确切输出结构,以获得可靠、一致的结果。

LLM 驱动

利用大型语言模型准确理解内容并提取信息。

多样化用例

非常适合抓取产品详情、新闻文章、体育比分、财务数据等。

接入路径

典型流程

告诉 API 你需要哪些字段,提供 JSON Schema,就能获得适合应用直接使用的干净数据。

1

提交目标 URL、自然语言提取提示词和 JSON Schema。

2

接收符合 schema 的数据,而不是原始网页文本。

3

验证结果并写入产品数据库或工作流。

适合场景

商品、价格和目录数据提取。

体育、金融和事件页面的数据规范化。

把非结构化文章转换成应用可存储字段。

自建爬虫经常遇到风控封锁?

如果你自己跑爬虫,经常被限流或被反爬机制拦截,可以通过我们的动态住宅代理转发请求,获得全新 IP 和地区定位。

常见问题

Extract API 为什么要使用 JSON Schema?

JSON Schema 可以明确告诉模型应用期望的结构,让后续校验和存储更可靠。

Extract API 消耗多少积分?

Extract API 每次请求消耗 10 积分。