DataJobs.io
← Back to all jobs

Job Description

Hands-on protocol data engineering role supporting an FDA proof of concept for AI-assisted clinical trial protocol review.

Responsibilities

  • Implement protocol data structures and physical schemas for extraction, normalization, storage, retrieval, comparison, and reviewer-facing use covering ICH M11-aligned and historical protocols.
  • Translate approved ICH M11, CDISC USDM, ontology, metadata, and terminology models into practical database structures and POC data-engineering components.
  • Develop and support ETL/ELT pipelines and data transformations for protocol content and structured outputs, preserving source provenance, metadata, assumptions, validation status, and reviewer feedback.
  • Collaborate with AI/prompt engineering and standards SMEs to support retrieval-augmented generation (RAG), semantic retrieval, indexing, evidence caching, and protocol comparison components.
  • Support integration with FDA-furnished Elsa/HALO capabilities and FDA-approved data services, including PostgreSQL and/or HALO/Databricks, for evidence caching, retrieval, analytics, and dashboard-ready outputs.
  • Build advanced SQL and data-access logic for protocol extraction, historical retrieval and comparison, reviewer dashboards, and traceability to source evidence.
  • Execute data-focused quality assurance, reconciliation, validation, and regression testing, including checks for completeness, mapping consistency, retrieval quality, unsupported values, ambiguity, and reproducibility.
  • Document data models, interfaces, transformations, mappings, implementation decisions, technical limitations, and operational considerations to support FDA review, knowledge transfer, and future expansion.
  • Work closely with clinical protocol, data standards, architecture, interoperability, and AI/prompt engineering SMEs.
  • Participate in FDA technical working sessions, POC demonstrations, validation activities, and iterative refinement based on reviewer feedback.
  • Support implementation within FDA-provided platforms and approved data environments; the base effort is a POC and does not require a separate production platform.
  • Provide practical database engineering and data-quality expertise while relying on designated SMEs for clinical interpretation and standards governance.

Requirements

  • Extensive experience in database engineering, data architecture, information modeling, and analytics in complex enterprise environments.
  • Strong expertise in relational and dimensional data modeling, metadata management, ETL/ELT design, data warehousing, and data quality.
  • Advanced SQL skills, including PostgreSQL/PLpgSQL and/or Oracle PL/SQL; SQL Server experience beneficial.
  • Experience with AWS data services and cloud database platforms such as Aurora PostgreSQL, Redshift, S3, Glue, Lambda, and DMS.
  • Experience integrating JSON/XML data and RESTful APIs; working knowledge of Python and CI/CD practices beneficial.
  • Federal health, clinical research, or regulated-environment experience preferred; familiarity with FISMA/NIST controls beneficial.

Technologies

  • PostgreSQL
  • PLpgSQL
  • Oracle PL/SQL
  • SQL Server
  • AWS
  • Aurora PostgreSQL
  • Redshift
  • S3
  • Glue
  • Lambda
  • DMS
  • JSON
  • XML
  • RESTful APIs
  • Python
  • CI/CD
  • Elsa/HALO
  • HALO/Databricks
  • ETL/ELT
  • RAG
  • FISMA
  • NIST
  • ICH M11
  • CDISC USDM

Location

  • Remote

Clearance

  • Must be able to obtain a High-Risk Public Trust

Education

  • BS degree in Computer Science, Mathematics, Data Science or relevant technical field

Similar Jobs