职位来自于拉勾
岗位职责:
1、负责PDF/Word/Excel等格式图文识别、分类、入库;
2、负责内外部网页内容抓取、去除干扰数据、标准化入库;
3、负责图片中文字内容识别、排版、纠错、标准化入库;
4、编写公共接口,为公司其他项目提供 PDF解析、网页解析、图文解析 等接口服务;
5、跟进OCR、爬虫、NLP前沿技术,将其工程化应用到公司产品中;
6、支持公司相关产品的研发工作。
任职要求:
1、**本科及以上学历;计算机、数学、信息技术、自然语言处理、数据挖掘相关专业;3年以上工作经验;
2、熟练使用 Python,熟悉相关环境部署,熟悉Linux常用命令;
3、熟悉 PyPDF2、PyMuPDF、Borb 等开源库,在项目中有实际使用经验;
4、熟悉 PaddleOCR、EasyOCR、Chineseocr、Tesseract、OpenCV 等开源库,有实际使用经验;
5、熟悉 Scrapy、Pyppeteer、Selenium,有实际使用经验;
6、熟练使用SQL,熟悉MySQL等关系型数据库;
7、有Django、Docker经验者优先;
8、工作积极主动,富有学习精神,愿意挑战高难度任务,编码规范。
Python爬虫工程师
上海宝衢文化传播有限公司
Shanghai, Shanghai, China
Python爬虫工程师
上海飞未信息技术有限公司
Wuhan, Hubei, China
python爬虫工程师
翼果(深圳)科技有限公司
Shenzhen, Guangdong, China
python爬虫工程师
Beijing Trs Information Technology Co., Ltd.
Beijing, Beijing, China
python爬虫工程师
引力传媒股份有限公司
Beijing, Beijing, China
python爬虫工程师
河北华网计算机技术有限公司
Shijiazhuang, Hebei, China