Dun & Bradstreet China
Linkedin · Posted 8d ago
爬虫工程师
Continue to application
Add your email once, then Caio opens the original posting.
Indexed description
该职位来源于猎聘 PURPOSE OF THE JOB(required for supervisory/managerial job): Summarize why this job exists and the contribution it makes to the overall business of the company 负责公司自研数据采集能力建设,聚焦高价值企业工商数据的增量补充与校验(日采集规模 ≤ 1 万家),通过 Python/Playwright 浏览器自动化、前端分析与接口逆向等手段,构建稳定、可监控的采集链路,支撑企业主档建设与数据质量提升。保障采集 7×24 稳定运行,协同数据治理与应用团队完成多源校验与入库规范对接,并评估外部 RPA/第三方数据源作为补充。当前阶段聚焦可行性验证与生产化落地,暂不追求分布式爬虫集群与大规模代理池建设。 PRINCIPAL ACCOUNTABILITIES: Describe the major activities of the job, emphasizing the end results which must be achieved (suggest listing from the most important task) 1. 采集系统建设与维护 设计并实现基于 Python + Playwright 的浏览器自动化采集服务 建设企业待更新库、任务队列、失败重试、采集监控告警等核心模块 负责采集结果的结构化解析、清洗、入库,对接 ODS / 企业主档数据规范 保障采集链路 7×24 稳定运行,对成功率、时效性、数据质量负责 2. 前端分析与接口逆向 熟练使用 Chrome DevTools(Network / Sources / Application)进行断点调试、请求抓包与调用栈分析 独立分析 Ajax / Fetch / XHR 请求链路,还原参数来源、Header、Cookie、Token 及调用时序 定位接口签名/加密逻辑(sign、timestamp、nonce、token 等),在 Python 中复现并实现稳定接口调用 处理 WebSocket、GraphQL、动态接口(接口地址/参数随页面或会话变化)等非标准 HTTP 采集场景 分析 JS 混淆、Webpack / Vite 打包代码,通过断点、Hook 或反混淆手段还原关键逻辑 优先采用「接口采集替代页面采集」:在逆向可行时,用 Requests / httpx 等替代浏览器渲染,降低成本、提升稳定性与并发 建立页面采集到接口采集的迁移机制:先页面验证可行性,再逆向固化接口方案,接口失效时具备降级回退能力 3. 反爬与稳定性应对 处理滑块验证、图片验证码、行为验证等常见风控手段 设计代理 IP 轮换、请求频率控制、浏览器指纹随机化等策略 应对 webdriver 检测、环境指纹、请求重放校验等前端防护机制 快速响应目标站点页面改版、DOM/JS 变更、接口变更、字段规则变化,缩短故障恢复时间 建立采集异常分类与自动/半自动重试机制 建立故障定位、脚本修复、降级回退与数据回补机制,确保因页面、接口或字段规则变更导致的采集中断能够及时恢复 4. 数据质量与业务协作 按业务优先级采集工商基础信息、变更记录、股东/人员、经营异常等高价值字段 与数据治理、数据应用团队协同,参与多源数据校验、字段映射、主档对齐 输出采集覆盖率、准确率、失败原因等日常运营报表 确保数据采集方案符合目标站点使用规则、公司内部数据合规及信息安全要求,在效率、稳定性与合规之间建立可持续的采集机制
- 技术演进 评估并对接外部RPA/第三方数据源,与自研采集形成互补 将逆向成果产品化(配置化接口模板、签名模块、失效告警) 保障采集能力持续迭代;视业务规模逐步优化架构,当前阶段不追求分布式爬虫集群与大规模代理池 在有限代理、计算与运维资源条件下,持续优化采集策略、调度机制和运行成本,提升采集稳定性、成功率与资源使用效率 6. 参与不定期发版、晚间值守或紧急支持 7. 上级主管或公司要求员工执行的与岗位相关的其他工作内容 MAJOR PROBLEMS / CHALLENGES (required for supervisory/managerial job): Describe 2 or 3 of the most difficult challenges or problems typically encountered in this job 1. 反爬与风控对抗 目标站点普遍存在滑块验证、图片验证码、行为验证等多层风控 IP 封禁(403)、频率限制、webdriver 检测、环境指纹等导致采集中断 需在有限代理资源下维持稳定采集,成本与成功率需平衡 2. 前端逆向与接口稳定性 接口签名/加密逻辑隐藏在混淆 JS 或 Webpack 打包代码中,逆向难度大、维护成本高 WebSocket、GraphQL、动态接口等场景增加分析与复现复杂度 目标站点接口或 JS 逻辑变更频繁,接口方案易失效,需快速定位并修复或降级回退 3. 页面与数据结构变更 目标站点页面改版、DOM/JS 变更、字段规则变化导致解析失败 需在较短时间内完成故障定位、脚本修复与数据回补 4. 数据质量与业务对齐 高价值企业增量更新(日采集 ≤ 1 万家)需在覆盖率、准确率、时效性之间取得平衡 5. 资源与架构约束 独立完成从验证到生产化的全链路建设 当前阶段不建设分布式爬虫集群与大规模代理池,需在轻量架构下保障 7×24 稳定运行 6. 合规与风险控制 采集行为需符合目标站点规则及公司内部数据合规要求 需在效率、稳定性与合规之间找到可持续方案 职位要求: EXPERIENCE, KNOWLEDGE, SKILLS, ABILITIES:
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search
Want help applying to roles like this?
Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search