[招聘] 生物医药 AI 公司|数据平台工程师|25~ 40K|上海
## 岗位职责:
1. 负责专业数据采集系统的设计、开发与维护,覆盖 API 接入、网页爬虫、动态页面及复杂数据源采集,并应对登录鉴权、验证码、访问限制、页面变化和复杂反爬机制。
2. 负责文本、PDF、Word、Excel、HTML、图片等结构化及非结构化数据的解析、清洗、标准化、质量校验和入库,建设可复用的数据处理 Pipeline。
3. 负责多类型数据库的选型、设计、开发与性能优化,包括 PostgreSQL、Elasticsearch、Milvus、Doris/ClickHouse、Neo4j 等;基于 FastAPI 建设稳定、高效的数据服务 API。
4. 建设面向运营和市场投放的用户数据体系,完成 PostHog 埋点方案设计,并基于 Kafka、Flink 等技术开发实时 ETL,支撑用户行为分析和多维查询。
5. 结合 LLM 与 BERT/Transformer 模型,从医学文献、临床试验报告、药品说明书及专利中提取疾病、药物、靶点、基因和不良反应等实体及关系,持续优化抽取准确率与召回率。
6. 完成医学实体的标准化、实体链接、关系融合及质量校验,建设并持续更新基于 Neo4j 等技术的医学知识图谱,为上层 AI 应用提供知识服务。
7. 主动与产品及业务团队协作,将模糊需求拆解为可落地的技术方案,独立完成设计、开发、测试、上线、监控及持续迭代,保障数据链路的稳定性、可维护性和可追溯性。
## 任职要求:
1. 具备扎实的 Python 编程能力,能够独立完成数据采集、数据处理、数据库开发及服务化输出的全链路建设。
2. 熟悉爬虫系统开发,具备处理登录鉴权、验证码、动态渲染、访问限制、反爬策略及数据源结构变化等问题的实战经验。
3. 熟悉至少一种主流关系型数据库和至少一种 OLAP/MPP 数据库,具有实际生产环境中的开发、建模或性能优化经验。
4. 熟悉 Elasticsearch、Milvus、Neo4j 中的至少两种,能够针对全文检索、向量检索和图关系查询等场景进行技术选型及优化。
5. 具备实时流数据处理经验,实际使用过 Kafka、Flink、Spark Streaming 等相关技术。
6. 具备基本的 LLM 应用开发经验,包括 Prompt Engineering、模型 API 调用、开源模型部署等至少一种实践。
7. 能够处理结构化和非结构化数据,具备 PDF、Word、Excel、HTML、图片等多格式数据的解析、清洗和标准化经验。
8. 具备独立工程交付能力,能够完成从数据采集、处理、存储、查询到 API 服务化的完整闭环,而非仅停留在算法验证或接口调用层面。
## 加分项:
1. 具有医学 NLP、生物医药实体识别或医学知识图谱的生产级项目经验,熟悉疾病、药物、靶点等医学实体及相关术语体系。
2. 具有 BERT/Transformer 模型微调、评估和生产部署经验,熟悉 ONNX、Triton 或 TorchServe;具有 PostHog 二次开发或完整埋点体系建设经验者优先。
3. 具备 Docker、Kubernetes、CI/CD 及云原生部署实践。
## 公司文化:
1. 务实的考核体系:结果导向,而非坐班导向:关注工作成果与业务价值,不以工作时长作为考核标准。
2. 灵活办公模式:每周 2 天居家办公(Hybrid Working),兼顾工作效率与生活平衡。
3. 贴心通勤福利:提供上下班打车费用报销,让通勤更轻松、更高效。
4. 开放、扁平、高效的团队文化:尊重专业、鼓励创新,为每一位成员提供充分发挥价值和持续成长的空间。
## 工作地点:上海
## 简历投递: joy_ss@foxmail.com
---
原文链接:[点击查看](https://www.v2ex.com/t/1233679)
1. 负责专业数据采集系统的设计、开发与维护,覆盖 API 接入、网页爬虫、动态页面及复杂数据源采集,并应对登录鉴权、验证码、访问限制、页面变化和复杂反爬机制。
2. 负责文本、PDF、Word、Excel、HTML、图片等结构化及非结构化数据的解析、清洗、标准化、质量校验和入库,建设可复用的数据处理 Pipeline。
3. 负责多类型数据库的选型、设计、开发与性能优化,包括 PostgreSQL、Elasticsearch、Milvus、Doris/ClickHouse、Neo4j 等;基于 FastAPI 建设稳定、高效的数据服务 API。
4. 建设面向运营和市场投放的用户数据体系,完成 PostHog 埋点方案设计,并基于 Kafka、Flink 等技术开发实时 ETL,支撑用户行为分析和多维查询。
5. 结合 LLM 与 BERT/Transformer 模型,从医学文献、临床试验报告、药品说明书及专利中提取疾病、药物、靶点、基因和不良反应等实体及关系,持续优化抽取准确率与召回率。
6. 完成医学实体的标准化、实体链接、关系融合及质量校验,建设并持续更新基于 Neo4j 等技术的医学知识图谱,为上层 AI 应用提供知识服务。
7. 主动与产品及业务团队协作,将模糊需求拆解为可落地的技术方案,独立完成设计、开发、测试、上线、监控及持续迭代,保障数据链路的稳定性、可维护性和可追溯性。
## 任职要求:
1. 具备扎实的 Python 编程能力,能够独立完成数据采集、数据处理、数据库开发及服务化输出的全链路建设。
2. 熟悉爬虫系统开发,具备处理登录鉴权、验证码、动态渲染、访问限制、反爬策略及数据源结构变化等问题的实战经验。
3. 熟悉至少一种主流关系型数据库和至少一种 OLAP/MPP 数据库,具有实际生产环境中的开发、建模或性能优化经验。
4. 熟悉 Elasticsearch、Milvus、Neo4j 中的至少两种,能够针对全文检索、向量检索和图关系查询等场景进行技术选型及优化。
5. 具备实时流数据处理经验,实际使用过 Kafka、Flink、Spark Streaming 等相关技术。
6. 具备基本的 LLM 应用开发经验,包括 Prompt Engineering、模型 API 调用、开源模型部署等至少一种实践。
7. 能够处理结构化和非结构化数据,具备 PDF、Word、Excel、HTML、图片等多格式数据的解析、清洗和标准化经验。
8. 具备独立工程交付能力,能够完成从数据采集、处理、存储、查询到 API 服务化的完整闭环,而非仅停留在算法验证或接口调用层面。
## 加分项:
1. 具有医学 NLP、生物医药实体识别或医学知识图谱的生产级项目经验,熟悉疾病、药物、靶点等医学实体及相关术语体系。
2. 具有 BERT/Transformer 模型微调、评估和生产部署经验,熟悉 ONNX、Triton 或 TorchServe;具有 PostHog 二次开发或完整埋点体系建设经验者优先。
3. 具备 Docker、Kubernetes、CI/CD 及云原生部署实践。
## 公司文化:
1. 务实的考核体系:结果导向,而非坐班导向:关注工作成果与业务价值,不以工作时长作为考核标准。
2. 灵活办公模式:每周 2 天居家办公(Hybrid Working),兼顾工作效率与生活平衡。
3. 贴心通勤福利:提供上下班打车费用报销,让通勤更轻松、更高效。
4. 开放、扁平、高效的团队文化:尊重专业、鼓励创新,为每一位成员提供充分发挥价值和持续成长的空间。
## 工作地点:上海
## 简历投递: joy_ss@foxmail.com
---
原文链接:[点击查看](https://www.v2ex.com/t/1233679)
· 0 个赞