Back to search
Dun & Bradstreet China Linkedin · Posted 8d ago

爬虫工程师

Shanghai

Linkedin
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

该职位来源于猎聘 PURPOSE OF THE JOB(required for supervisory/managerial job): Summarize why this job exists and the contribution it makes to the overall business of the company 负责公司自研数据采集能力建设,聚焦高价值企业工商数据的增量补充与校验(日采集规模 ≤ 1 万家),通过 Python/Playwright 浏览器自动化、前端分析与接口逆向等手段,构建稳定、可监控的采集链路,支撑企业主档建设与数据质量提升。保障采集 7×24 稳定运行,协同数据治理与应用团队完成多源校验与入库规范对接,并评估外部 RPA/第三方数据源作为补充。当前阶段聚焦可行性验证与生产化落地,暂不追求分布式爬虫集群与大规模代理池建设。 PRINCIPAL ACCOUNTABILITIES: Describe the major activities of the job, emphasizing the end results which must be achieved (suggest listing from the most important task) 1. 采集系统建设与维护 – 设计并实现基于 Python + Playwright 的浏览器自动化采集服务 – 建设企业待更新库、任务队列、失败重试、采集监控告警等核心模块 – 负责采集结果的结构化解析、清洗、入库,对接 ODS / 企业主档数据规范 – 保障采集链路 7×24 稳定运行,对成功率、时效性、数据质量负责 2. 前端分析与接口逆向 – 熟练使用 Chrome DevTools(Network / Sources / Application)进行断点调试、请求抓包与调用栈分析 – 独立分析 Ajax / Fetch / XHR 请求链路,还原参数来源、Header、Cookie、Token 及调用时序 – 定位接口签名/加密逻辑(sign、timestamp、nonce、token 等),在 Python 中复现并实现稳定接口调用 – 处理 WebSocket、GraphQL、动态接口(接口地址/参数随页面或会话变化)等非标准 HTTP 采集场景 – 分析 JS 混淆、Webpack / Vite 打包代码,通过断点、Hook 或反混淆手段还原关键逻辑 – 优先采用「接口采集替代页面采集」:在逆向可行时,用 Requests / httpx 等替代浏览器渲染,降低成本、提升稳定性与并发 – 建立页面采集到接口采集的迁移机制:先页面验证可行性,再逆向固化接口方案,接口失效时具备降级回退能力 3. 反爬与稳定性应对 – 处理滑块验证、图片验证码、行为验证等常见风控手段 – 设计代理 IP 轮换、请求频率控制、浏览器指纹随机化等策略 – 应对 webdriver 检测、环境指纹、请求重放校验等前端防护机制 – 快速响应目标站点页面改版、DOM/JS 变更、接口变更、字段规则变化,缩短故障恢复时间 – 建立采集异常分类与自动/半自动重试机制 – 建立故障定位、脚本修复、降级回退与数据回补机制,确保因页面、接口或字段规则变更导致的采集中断能够及时恢复 4. 数据质量与业务协作 – 按业务优先级采集工商基础信息、变更记录、股东/人员、经营异常等高价值字段 – 与数据治理、数据应用团队协同,参与多源数据校验、字段映射、主档对齐 – 输出采集覆盖率、准确率、失败原因等日常运营报表 – 确保数据采集方案符合目标站点使用规则、公司内部数据合规及信息安全要求,在效率、稳定性与合规之间建立可持续的采集机制

  • 技术演进 – 评估并对接外部RPA/第三方数据源,与自研采集形成互补 – 将逆向成果产品化(配置化接口模板、签名模块、失效告警) – 保障采集能力持续迭代;视业务规模逐步优化架构,当前阶段不追求分布式爬虫集群与大规模代理池 – 在有限代理、计算与运维资源条件下,持续优化采集策略、调度机制和运行成本,提升采集稳定性、成功率与资源使用效率 6. 参与不定期发版、晚间值守或紧急支持 7. 上级主管或公司要求员工执行的与岗位相关的其他工作内容 MAJOR PROBLEMS / CHALLENGES (required for supervisory/managerial job): Describe 2 or 3 of the most difficult challenges or problems typically encountered in this job 1. 反爬与风控对抗 – 目标站点普遍存在滑块验证、图片验证码、行为验证等多层风控 – IP 封禁(403)、频率限制、webdriver 检测、环境指纹等导致采集中断 – 需在有限代理资源下维持稳定采集,成本与成功率需平衡 2. 前端逆向与接口稳定性 – 接口签名/加密逻辑隐藏在混淆 JS 或 Webpack 打包代码中,逆向难度大、维护成本高 – WebSocket、GraphQL、动态接口等场景增加分析与复现复杂度 – 目标站点接口或 JS 逻辑变更频繁,接口方案易失效,需快速定位并修复或降级回退 3. 页面与数据结构变更 – 目标站点页面改版、DOM/JS 变更、字段规则变化导致解析失败 – 需在较短时间内完成故障定位、脚本修复与数据回补 4. 数据质量与业务对齐 – 高价值企业增量更新(日采集 ≤ 1 万家)需在覆盖率、准确率、时效性之间取得平衡 5. 资源与架构约束 – 独立完成从验证到生产化的全链路建设 – 当前阶段不建设分布式爬虫集群与大规模代理池,需在轻量架构下保障 7×24 稳定运行 6. 合规与风险控制 – 采集行为需符合目标站点规则及公司内部数据合规要求 – 需在效率、稳定性与合规之间找到可持续方案 职位要求: EXPERIENCE, KNOWLEDGE, SKILLS, ABILITIES:

List the experience, knowledge, skills and abilities necessary to do the job in a fully competent manner 1. 学历与经验 – 本科及以上学历,计算机或相关专业 – 3 年以上数据采集/爬虫开发经验,能独立负责一条采集链路从 0 到 1 2. 技术知识与技能 – 精通 Python,熟悉异步编程、HTTP 协议、HTML/CSS/XPath/CSS Selector 解析 – 熟练使用 Playwright(或 Puppeteer / Selenium)进行浏览器自动化,有 Headless 部署经验 – 具备反爬对抗实战经验:验证码、IP 封禁(403)、频率限制、Cookie/Session 管理 – 熟悉代理 IP 使用与轮换策略,能独立排查采集链路故障 – 具备任务调度、队列、重试、监控告警设计与落地能力 – 代码规范良好,有日志、告警、文档意识 3. 前端分析与逆向能力 – 熟练使用 Chrome DevTools 进行调试、抓包、调用栈分析与本地 Override – 能独立分析 Ajax / Fetch 请求链路,还原完整数据加载流程 – 具备接口签名逆向经验,能定位 encrypt / sign / token 生成逻辑并在服务端复现 – 能处理 WebSocket、GraphQL、动态接口等采集场景 – 能阅读和分析 JS 混淆、Webpack 打包代码,提取关键加密/签名函数 – 有接口采集优先实践经验:在逆向可行时,用 HTTP 客户端替代浏览器自动化
Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search