候选人档案初始化 · Candidate Profile
$ py-resume --init# 正在加载候选人档案 ... 已加载身份信息   姓名="邱鑫宇" 已加载岗位定位   目标="Python 爬虫工程师 / 数据采集工程师" 已加载经验数据   年限=1.5 年经历=3 段 核心亮点:百度 · 解析准确率 88%→97% · 动态覆盖率 +35pp $ cat ./profile.json | jq '.focus'"爬虫 · 数据采集 · 数据工程"

构建稳健可靠的
数据链路,从网络请求到业务洞察

软件工程本科,1 年+ Python 爬虫与数据采集经验,曾任职百度从事移动端抓取与收录研发。擅长从 HTTP 爬虫Headless Chrome 渲染爬虫的架构演进,熟悉数据采集、清洗、存储到可视化的完整链路。

Request采集
Parse解析
Store存储
Analyze分析
Visualize可视
0%
解析准确率
0%
索引增长
0%
动态覆盖率
0%
效率提升

工作经历

WORK EXPERIENCE
3 段经历

北京汇创思拓数字科技有限公司 · 河北分公司

2026.02 – 至今
Python 爬虫工程师
工作内容
  • 基于影刀 RPA 构建电商数据自动化采集平台,面向抖音电商生态,批量采集达人、商品及短视频内容数据。
  • 覆盖粉丝量、带货能力、销售数据、互动率等多维度核心指标,搭建标准化的数据采集链路。
  • 设计并优化自动化流程,攻克登录鉴权、分页遍历、动态渲染与详情页解析等关键环节,提升采集效率、降低人工干预。
工作业绩
  • 完成数据清洗、去重与结构化落库(ETL),支撑运营选品、达人筛选与市场分析,显著提升数据获取效率与业务决策能力。
影刀 RPA 抖音电商 ETL 数据清洗

百度在线网络技术(北京)有限公司

2025.07 – 2025.10
移动抓取与收录研发工程师
工作内容
  • 参与海量数据分布式爬虫采集系统建设,与团队共同攻克高性能、高并发、高可用等技术场景下的技术挑战。
  • 根据整体技术方案完成高质量开发、自测及项目文档编写,攻克特定场景下的抓取难题。
工作业绩
  • 构建完整的数据质量监控与反馈闭环体系,定义并追踪「正文抽取准确率」「关键信息缺失率」等核心指标,推动数据解析准确率从 88% 提升至 97%
  • 主导传统 HTTP 爬虫向 Headless Chrome 渲染爬虫的架构演进,新系统上线后移动端索引页面数量提升约 40%
  • 针对 Vue.js、React 等框架构建的动态内容网站,覆盖率从 不足 60% 提升至 95% 以上
分布式爬虫 Headless Chrome 数据质量监控 Vue / React 动态渲染

北京国信创新科技股份有限公司

2025.01 – 2025.06
爬虫工程师(实习)
工作内容
  • 运用 Python 及 HTML、CSS、JavaScript 编写网络爬虫代码,研究网页接口规律与特点。
  • 负责数据源的排查与新增,对缺失数据的网站进行栏目与 URL 补充并上线运行。
  • 基于 PySpider、Selenium、Requests 等爬虫框架获取网页数据并进行打包处理。
工作业绩
  • 开发并部署高效网络爬虫,实现目标网站数据自动化抓取,数据获取效率提升超 50%,确保数据时效性与准确性。
  • 优化爬虫策略并引入代理 IP 池,有效规避目标网站反爬机制,保障抓取的稳定性与安全性。
  • 采用并发请求与异步执行技术优化爬虫性能,缩短抓取周期、提升单位时间抓取量。
PySpider Selenium Requests 代理 IP 池 异步并发

项目经验

PROJECTS
3 个项目

AI 智能面试辅助平台 Interview-Guide

2026.02 – 至今

基于 Java 的 AI 应用开发项目,依托 Spring Boot + Spring AI 对接大模型,结合 RAG 检索增强与 PgVector 向量数据库,通过接口调用、POI 文档解析获取简历与面试知识库数据,循环批量处理业务数据,最终打包生成 PDF / TXT 格式面试评测文档。

主要工作
  • 存储设计:PostgreSQL + PgVector 存储向量化知识库,MySQL 存用户与面试记录业务数据,Redis 缓存高频面试题,PDF / TXT 存储分析报告。
  • 数据读取:运用 RAG 向量检索、POI 文档解析、IO 文件流与 Spring AI 接口调用,完成简历文档与知识库文件的数据读取与持久化写入。
Spring Boot Spring AI RAG PgVector PostgreSQL Redis MySQL

睿选商务数据驾驶舱

2026.02 – 至今

基于前端技术构建的商务数据可视化平台,部署于 Cloudflare Pages,面向商务运营团队。通过数据清洗、格式转换与多维度计算,将 Excel 原始商务数据转化为直观的可视化仪表盘,支持多时间段数据展示与品牌 / 达人 / 商务排行分析。

主要工作
  • 数据存储:Excel 存储原始商务数据,前端本地缓存计算结果,Cloudflare Pages 静态托管页面资源。
  • 数据读取:使用 SheetJS(xlsx)解析 Excel,JavaScript 自定义计算规则完成数据清洗与格式转换。
  • 功能开发:设计五时间段数据展示、品牌 TOP5 排行、达人合作统计、商务负责人业绩排行等核心功能。
Cloudflare Pages SheetJS Chart.js ECharts HTML / CSS / JS

电影市场票房分析与可视化系统

2024.01 – 2024.07

基于 Python 的数据抓取与分析脚本,通过访问艺恩娱数提供的 API 接口获取中国大陆电影票房排行榜数据,随后进行清洗、统计与可视化,直观展示票房年度占比与变化趋势。

主要工作
  • 数据抓取:定义 main 函数自动从指定 API 获取票房数据。
  • 数据存储:将抓取到的数据以 CSV 格式落盘,便于后续分析与处理。
  • 数据分析:data_analyze 读取 CSV,计算各年度票房占比、绘制趋势图,识别平均票价与平均场次最高的电影。
Requests CSV Pandas Matplotlib

技能特长

SKILLS
5 项核心
Python 开发与数据解析熟练 · 90%
动态网页处理(Selenium / Headless Chrome)熟练 · 85%
数据存储与管理(MySQL / MongoDB / ETL)熟练 · 80%
前端开发(HTML / CSS / JavaScript)熟悉 · 70%
AI 应用与 RAG 检索增强熟悉 · 65%

// 深入理解 HTTP 协议,熟练模拟浏览器行为(Cookies、Headers);熟练运用 requests、urllib、PySpider 进行网络请求;掌握 BeautifulSoup、正则表达式等数据解析技术;具备 Java 调试、Maven 环境搭建及 Spring Boot 项目经验。

教育背景

EDUCATION
本科

燕京理工学院 · 软件工程 · 本科

Bachelor of Engineering · Software Engineering
2021.09 – 2025.06
核心课程

数据结构、Java、Python、数据库原理、软件测试技术、Web 企业级开发、Linux 系统、计算机组成原理

相关证书

高级软件工程师 · Web 安全渗透测试 · 鸿蒙 OpenHarmony 人才认证

校内实践

担任志愿者协会实践部部长,多次组织校园志愿活动并完成校外对接,获「优秀志愿者」荣誉证书。

校园经历

CAMPUS
1 段经历

志愿者协会 · 实践部部长

Volunteer Association · Director of Practice
2022.03 – 2023.02
  • 多次组织并参与校园志愿活动(烈士陵园扫墓、关爱老人、核酸检测),带领部门完成与校外机构的对接。

自我评价

ABOUT ME
个人简介
about_me.py · 代码化自述
1# 用 Python 风格描述一位爬虫工程师的自我定位
2class Engineer:
3    def __init__(self):
4      self.name = "邱鑫宇"
5      self.focus = "爬虫 · 数据采集 · 数据工程"
6      self.experience = "1年+"
7      self.stack = ["Python", "Requests", "Selenium", "Headless Chrome"]
8      self.achievements = {
9        "解析准确率": "88% → 97%",
10        "动态页面覆盖率": "<60% → 95%+",
11        "移动端索引增长": "+40%",
12        "抓取效率提升": "+50%",
13      }
14      self.status = "OPEN_TO_WORK"
15 
16    def think(self):
17      return "稳定、高效、工程化"
18 
19# 期待加入一支重视工程质量的团队
已复制