- Architect, build, and maintain production-grade data platforms and scalable ELT/ETL pipelines.
- Ingest, transform, and model complex structured and unstructured scientific and clinical datasets.
- Define data architecture patterns, engineering standards, and best practices across the team.
- Collaborate with scientists, ML engineers, and business stakeholders to turn domain needs into data solutions.
- Design data infrastructure that supports machine learning training, inference, and analytics workloads.
- Ensure data quality, lineage, reproducibility, security, and system observability.
- Optimize pipeline performance, architectural bottlenecks, and infrastructure cost efficiency.
- Participate in technical design discussions, code reviews, and architectural decision-making.
PythonSQLCloud Computing+3 more