概述
我们交付的是数据管道,不是一次性脚本
大多数采集项目不是死在第一次运行,而是死在第二次。页面模板改了、某个分类换了翻页方式、某个字段挪进了标签页里,数据集就悄无声息地少掉三分之一的记录。抽取本身是最容易的部分,让它长期保持正确才是真正的工作量。
我们把每个项目拆成三层来做:抓取、解析、校验。站点改版时只需要动解析层;而校验层会在你从数据里察觉到任何异常之前就先报警。
每个项目交付时都附一份字段说明、一份与来源自身公开列表数量的对账(前提是来源公布了总数),以及一份写明哪些数据没能采到、为什么没采到的说明。如果我们判断官方 API 或授权数据源比采集更合适,我们会直说。
输出示例
同一份数据,画在地图上
这里是静态预览,而不是内嵌地图 SDK,页面因此保持轻快。交互式地图可以作为可视化项目单独构建。
服务范围
我们能抽取什么
只要是你有权访问的页面上公开发布的内容,基本都能变成一列数据。常见的采集对象包括:
商品与目录数据
跨品类的名称、编号、规格参数、库存状态与公开价格。
企业名录
公司名称、地址、联系方式、所属类别与分支机构清单。
挂牌与库存信息
房产、车辆、职位或场地类挂牌信息,含其公开属性与发布时间。
评价与评分
综合评分、评价数量,以及在项目范围允许时抽取评价正文,用于情感分析。
内容与文章
标题、作者、发布时间、标签与正文,用于构建研究语料。
文档与表格
锁在公开 PDF、统计报表与开放数据门户里的数值。
变更历史
对同一批页面反复采集,从而衡量两次运行之间发生了什么变化。
图片与媒体引用
采集来源地址与元数据,用于分析而非二次分发。
交付格式
按你的技术栈习惯的方式交付
- CSV
- 扁平结构,UTF-8 编码,一行一条记录。把数据交到分析师手上最快的方式。
- Excel
- 含数据表、字段说明表与运行汇总表的工作簿。
- JSON / JSONL
- 嵌套结构用于无法干净拉平的数据;数据量大时用按行分隔的 JSONL 输出。
- Parquet
- 列式输出,适合导入数据仓库或数据湖的大规模数据集。
- 入库交付
- 直接写入 PostgreSQL、PostGIS、BigQuery,或你自己掌控的 S3 存储桶。
样例数据
你实际拿到的是什么
示例项目数据。每次交付都带采集时间戳,任何一行数据有多新,一眼可查。
| 记录编号 | 门店名称 | 城市 | 邮编 | 开业时间 | 状态 | 采集时间 |
|---|---|---|---|---|---|---|
| ST-000141 | Riverside Market | Portland | 97209 | 2018-04 | 营业中 | 2026-08-11 |
| ST-000142 | Pearl District Market | Portland | 97210 | 2021-09 | 营业中 | 2026-08-11 |
| ST-000143 | Alberta Street Market | Portland | 97211 | 2016-11 | 暂停营业 | 2026-08-11 |
| ST-000144 | Beaverton Market | Beaverton | 97005 | 2019-02 | 营业中 | 2026-08-11 |
| ST-000145 | Vancouver Waterfront | Vancouver | 98660 | 2023-06 | 营业中 | 2026-08-11 |
服务流程
五个步骤,每个项目都一样
- 步骤 01
说明你需要什么数据
把你心里的目标页面或来源发给我们,以及这份数据最终要回答什么问题。
- 步骤 02
我们确定数据范围
共同敲定字段清单、覆盖范围、刷新频率,以及可接受的误差范围。
- 步骤 03
我们采集并处理数据
抓取、解析与归一化作为彼此独立、各自受监控的阶段运行。
- 步骤 04
我们校验数据集
每一批数据都会跑记录数、字段完整度、类型检查与重复检测。
- 步骤 05
我们交付最终成果
数据按你指定的格式或目标位置落地,并附文档与运行报告。
每个抽取任务按各自的范围报价:数据量、来源复杂度,持续运行的管道还要看运行频率与监控要求。把来源和字段发给我们,正式运行之前你会先拿到固定报价。
常见问题
客户经常问到的问题
你们能处理什么样的网站?
可公开访问的页面、开放数据门户、公开发布的文档,以及你有权访问的来源。服务端渲染和 JavaScript 渲染的页面都可以。我们不接需要绕过登录、付费墙或反爬防护的来源。
站点改版了怎么办?
解析与抓取是隔离开的,每次运行都会按预期记录数与字段完整度做校验。模板一变,校验环节会直接报错,我们随即修复解析规则——在持续维护的项目上,通常一个工作日内完成。
可以按固定周期采集吗?
可以。按日、按周、按月都很常见。周期性项目会附变更日志,让你清楚看到两次运行之间新增、消失和被修改的分别是哪些记录。
重复数据怎么处理?
我们会先约定一个业务主键,比如来源方的编号,或者名称加地址的组合,再据此去重。近似重复用字符串归一化匹配来判定,涉及位置的还会加上距离阈值。规则都会写进交付文档。
最终数据归谁所有?
归你。我们只交付数据集与文档,不会把你项目的产出转卖给别人;项目结束后,只要你要求,我们会删除工作副本。
如果数据本来就不公开呢?
那我们会尽早告诉你。视具体情况,我们会建议你走官方 API、授权数据商,或者改用调研方式。一句明确的「做不了」,比一份你既不敢信也用不上的数据更有价值。
下一步
有具体的数据需求?
告诉我们网页数据采集需要覆盖哪片地域、包含哪些字段、多久刷新一次。正式开工前,你会先拿到明确方案、样例数据与固定报价。