Jin-Ho Lee

Bioinformatik · Data Science

EN

Jin-Ho Lee

// eine Quelle — pdf · web · json · jsonld · text

name: Jin-Ho Lee
headline: Bioinformatik · Data Science
roots: [cancer-genomics, HLA-typing, neoantigens]
stack: [NGS, TensorFlow, Python (Expert), GCP]
publications: 15  # Erst-/geteilte Erstautorenschaft
tagline: >-
  Data Scientist mit Wurzeln in der Krebsgenomik — HLA-Typisierung & Neoantigen-Identifizierung an echten Patientendaten, Produktiv-ML auf GCP, 10+ Publikationen.
 

Profil

Jin-Ho Lee

Jin-Ho Lee ist Bioinformatiker und Data Scientist in Mannheim. Er entwickelt In-silico-Pipelines zur HLA-Typisierung und Neoantigen-Identifizierung aus NGS- und RNA-Seq-Daten von Krebspatienten und liefert produktives Machine Learning auf der Google Cloud. Er hat einen M.Sc. der Universität Heidelberg und 10+ peer-reviewed Publikationen.

Data Scientist mit Wurzeln in der Krebsgenomik — HLA-Typisierung & Neoantigen-Identifizierung an echten Patientendaten, Produktiv-ML auf GCP, 10+ Publikationen.

Data Scientist mit tiefen Wurzeln in der Krebsgenomik. Entwicklung von In-silico-Pipelines zur HLA-Typisierung und Neoantigen-Identifizierung aus realen Patienten-NGS- und RNA-Seq-Daten, aufbauend auf Wet-Lab-Ausbildung und Pipeline-Entwicklung an DKFZ, NCT, FZ Jülich, KIP und SNU. Eine parallele Forschungslinie in der experimentellen Biophysik brachte 10+ peer-reviewed Publikationen — als Erstautor sowie mit geteilter Erstautorschaft — in der hochauflösenden Mikroskopie von DNA-Schadensreparatur und Chromatin hervor.

Diese Sorgfalt nun in der Industrie: Architektur der Migration von 1.000+ analytischen Prozessen in die Google Cloud, Entwicklung von BigQueryML-Modellen für Geldwäscheprävention & KYC sowie Schulung von 100+ Fachkräften in Python, SQL & ML; Einwerbung von Drittmitteln und Betreuung von 10+ Studierenden.

Berufserfahrung

ML/AI-Engineer & Open-Source-Entwickler · Independent / Self-Directed

Aug 2025 – heute

  • Agenten-KI: Entwicklung von End-to-End-LLM-Agentensystemen — Tool-Nutzung, Planung, Routing, Multi-Agenten-Orchestrierung und persistenter Speicher — sowie Veröffentlichung von Open-Source-Tooling für Claude Code.
  • Computer Vision: Training skelettbasierter Action-Recognition-Modelle zur Badminton-Schlagklassifikation aus Videodaten — vollständige Pipeline von der Frame-Annotation über das Training bis zur Evaluation (PyTorch, MediaPipe). D2
  • Bioinformatik: Veröffentlichung einer reproduzierbaren Snakemake-Pipeline zur Splice-Neoepitop-Identifizierung mit struktureller Validierung via AlphaFold2/OpenFold. L5

Berater, Lead Business Functional Analyst · Cintellic / International Bank

Mai 2024 – Jul 2025

  • Skalierung: Architektur der Migration von 1.000+ analytischen Prozessen in die Google Cloud. C2
  • KI in Produktion: Entwicklung von BigQueryML-Modellen für Geldwäscheprävention & KYC. C1
  • Stakeholder Lead: Brückenfunktion zwischen technischem Data Engineering und Fachanforderungen im hochregulierten Bankensektor. C1C2

Data Science Trainee, Associate & Coach · neuefische GmbH

Feb 2023 – Apr 2024

  • Coaching: Schulung von 100+ Fachkräften in Python, SQL und ML-Lebenszyklen. D3
  • ML-Entwicklung: Eigenständige Entwicklung eines Echtzeit-ASL-Erkennungsprototyps mit LSTMs, MediaPipe und TensorFlow. D1

Doktorand & Postgraduierter Forscher · FZ Jülich / KIP / NCT / SNU / DKFZ

Apr 2014 – Jul 2022

  • Genomik & Immuntherapie: Entwicklung von in-silico-Pipelines zur HLA-Typisierung und Neoantigen-Discovery aus NGS- und RNA-Seq-Splice-Junction-Daten von Krebspatienten; Validierung von SNV-Calls gegen Goldstandard-Sequenzierung in klinischen Kolorektal-Kohorten (NCT/DKFZ). L1L2
  • Biophysik & Bildgebung: End-to-End-Leitung von Super-Resolution-Mikroskopie-Projekten — von Wet-Lab-Forschung bis zur räumlichen Punktmuster-Analyse (MATLAB/Python) zur Untersuchung von Chromatin. L3
  • Neurobiologie: Untersuchung von Strahlungseffekten auf die neuronale Vorläuferdifferenzierung mit 3D-Zellmodellen sowie der Rolle extrazellulärer Vesikel. L4

Projekte

Lebenswissenschaften

L1

Krebs-Neoantigen-Entdeckung – Transkriptomweite Splice-Analyse

Bioinformatik-Forschungspraktikant (Seoul National University) · Aug 2015 – Nov 2015

Bioinformatik-Pipeline zur Identifizierung neuartiger Immuntherapie-Targets aus aberrantem alternativem Splicing in RNA-Seq-Daten.

Details
  • Entwicklung einer Discovery-Pipeline zur Identifizierung tumorspezifischer Splice-Junctions in großen Krebs-Datensätzen.
  • Kartierung der Epitop-Landschaft durch Vorhersage hochaffiner MHC-I-bindender Peptide aus nicht-kanonischen Transkripten.
  • Validierung des Vorhersagemodells durch Abgleich der Ergebnisse mit hochrangigen transkriptomischen Studien.
  • Bewertung synergistischer Strategien zur kombinierten Adressierung mutations- und splice-abgeleiteter Neoantigene.

Nachgewiesen, dass alternatives Splicing eine geeignete Quelle für hochaffine Epitope darstellt und die Target-Identifizierung über klassische somatische Mutationen hinaus erweitert.

PythonRMapSpliceRNA-SeqTCGA DatasetsMHC-I Prediction Tools

L2

Personalisierte Immuntherapie – Hochdurchsatz-HLA-Typisierungs-Pipeline

Bioinformatik-Bachelorand (NCT Heidelberg) · Apr 2014 – Mai 2014

Bioinformatischer Workflow zur Identifizierung patientenspezifischer Krebs-Targets und Automatisierung der HLA-Genotypisierung aus Next-Generation-Sequencing-Daten (NGS).

Details
  • Entwicklung einer in silico Genotypisierungs-Pipeline zur direkten Extraktion von HLA-Allelen aus Whole-Exome-Sequencing-Daten (WXS).
  • Implementierung prädiktiver Modellierung mittels ANNs (NetMHCPan) zum Screening von Missense-Mutationen auf MHC-I-Bindungsaffinität.
  • Konzeption einer Konsens-Methodik zur Integration mehrerer HLA-Typisierungs-Algorithmen zur Auflösung von Sequenz-Ambiguitäten und Steigerung der diagnostischen Zuverlässigkeit.
  • Validierung der Pipeline durch Analyse der Bindungsspezifitäten über HLA-Allele hinweg zur Reduzierung von Typisierungsfehlern im Impfstoffdesign.

Nachgewiesen, dass ein vollständig computergestützter Ansatz zur Neoantigen-Entdeckung praktikabel ist und Kosten sowie Vorlaufzeiten gegenüber klassischen PCR-basierten klinischen Assays deutlich reduziert.

PythonRHLAMinerSeq2HLANetMHCPan (Neural Networks)Shell Scripting

L3

Experimentelle Biophysik — Chromatin-Nano-Architektur & DNA-Reparatur

Wissenschaftlicher Mitarbeiter / Masterand · Feb 2017 – Aug 2018

Fortgeschrittene Forschung mit Super-Resolution-Mikroskopie und computergestützter Analyse zur Untersuchung von DNA-Reparaturmechanismen und Chromatin-Nano-Architektur.

Details
  • Experimentelles Design: Entwicklung und Durchführung von Forschungsprojekten zu DNA-Reparaturwegen und Super-Resolution-Bildgebung von Chromatinstrukturen.
  • Datenanalyse & Modellierung: Einsatz von MATLAB, R und Python zur Verarbeitung komplexer Bilddaten und zur quantitativen Analyse nanoskaliger Strukturen.
  • Wissenschaftliche Leitung: Steuerung internationaler Forschungskooperationen und Betreuung mehrerer Bachelor- und Masterstudierender über den gesamten Projektverlauf.

Veröffentlichung der Forschungsergebnisse in mehreren peer-reviewten Fachzeitschriften und Einwerbung von Drittmitteln für weiterführende wissenschaftliche Untersuchungen.

MATLABLinuxRPythonCOMBO-FISHSPDMDBSCAN

L4

Neurale Stammzellforschung – Strahlungseffekte auf 3D-Differenzierung

Promotionsforscher (RWTH Aachen, Forschungszentrum Jülich) · Sep 2018 – Jul 2022

Wissenschaftliches Forschungsprojekt zur Untersuchung der Auswirkungen ionisierender Strahlung und extrazellulärer Vesikel auf die Differenzierung humaner neuronaler Vorläuferzellen.

Details
  • Experimentelles Design: Entwicklung und Durchführung eines mehrjährigen Forschungsprojekts an der Schnittstelle von Strahlenbiologie und Neurowissenschaft.
  • Führung & Mentoring: Betreuung und Anleitung von Studierenden, wissenschaftlichem Nachwuchs und technischem Personal in komplexen Laborabläufen.
  • Wissenschaftliche Kommunikation: Einwerbung von Drittmitteln, Aufbau von Forschungskooperationen und Publikation der Ergebnisse in peer-reviewten Fachzeitschriften.

Erfolgreiche Identifizierung neuer Erkenntnisse zu neuronalen Strahlungsantworten sowie Präsentation der Ergebnisse auf internationalen wissenschaftlichen Konferenzen.

3D Cell Culture ModelingqPCRFluorescence MicroscopyFACSBiochemistryImageJMS Office

L5

Splice-Neoepitop-Pipeline – Reproduzierbarer Snakemake-Workflow

Autor und Maintainer (Open Source) · Mär 2026 – heute

Modernisierte, Open-Source-Neuimplementierung der SNU-Arbeit von 2015 zur splice-junction-basierten Neoepitop-Identifizierung als reproduzierbare Snakemake-Pipeline mit optionaler struktureller Validierung.

Read in English →

Details
  • Neuentwicklung der ursprünglichen SNU-Pipeline als vollständig reproduzierbarer Snakemake-8.x-Workflow mit Conda-Umgebungen pro Rule — installierbar ohne manuelles Dependency-Management; lauffähig lokal und auf GCP-GPU-VMs, und per Design executor-portabel auf einen SLURM-Cluster (Ressourcen pro Rule + Conda) — ein Konfigurations-Swap, kein Rewrite.
  • Tumor-vs-passendes-Normalgewebe-Junction-Filterung gegen GENCODE-Annotation implementiert; klassifiziert Junctions als annotated, normal_shared oder tumor_exclusive.
  • Patientenspezifische HLA-Typisierung (OptiType) und MHC-I-Peptidpräsentations-Vorhersage (MHCflurry 2.x Class1PresentationPredictor) integriert für End-to-End-Neoepitop-Kandidatenranking.
  • Optionale strukturelle Validierung des TCR-pMHC-Ternärkomplexes via TCRdock (AlphaFold-v2-Backend) auf Google Cloud GPU; vorhergesagte Komplexe werden im interaktiven Mol* 3D-Viewer dargestellt.
  • MIT-lizenziert, öffentlich auf GitHub (Jin-HoMLee/splice-neoepitope-pipeline).

Snakemake-Pipeline: End-to-End-Neoepitop-Identifizierung von RNA-Seq-FASTQ bis zur computergestützt modellierten TCR-pMHC-Komplexstruktur — patientenspezifische HLA-Allele, tumor-exklusive Junctions.

Snakemake 8.xCondaPython 3.11HISAT2 / STAROptiTypeMHCflurry 2.xTCRdock / AlphaFold v2bedtoolsGoogle Cloud GPUMol*

Data Science

D1

SignMeUp – Echtzeit-Erkennung der American Sign Language (ASL)

Projektmanager / Data Scientist (neuefische GmbH) · Sep 2023 – Dez 2023

Machine-Learning-Pipeline und Anwendungsprototyp zur Echtzeit-Erkennung von ASL-Gesten, konzipiert für die Integration in eine digitale Lern-App für Gebärdensprache.

Details
  • Projektleitung: Definition des Projektumfangs, Steuerung der Team-Kommunikation und Durchführung von Stakeholder-Präsentationen.
  • Modellentwicklung: Konzeption und Optimierung eines LSTM-Neuronennetzes zur Klassifikation zeitlicher Sequenzen von ASL-Gesten.
  • Data Engineering: Entwicklung einer Pipeline zur Echtzeit-Landmark-Extraktion, Feature-Engineering und Datenbereinigung aus Video-Streams.

Lieferung eines funktionsfähigen Prototyps für Echtzeit-Inferenz, der unmittelbares Feedback für Lernende der Gebärdensprache ermöglicht.

PythonTensorFlow (Keras)LSTMMediaPipeOpenCVGoogle CloudScikit-LearnMLflow

D2

Shuttle Insights – KI-gestützte Badminton-Spielanalyse

Data Scientist / Entwickler · Jan 2024 – Apr 2024

Computer-Vision-System zur Analyse von Badminton-Gameplay aus Videoaufzeichnungen.

Details
  • Entwicklung einer Computer-Vision-Pipeline zur Erkennung von Spielern und zum Tracking der Shuttle-Flugbahnen.
  • Implementierung von Pose-Estimation-Modellen zur Analyse von Bewegungsmustern der Spieler.
  • Extraktion von Spielmetriken wie Ballwechseldauer und Spielerpositionierung.

Funktionsfähiger Prototyp, der Match-Statistiken und Bewegungsanalysen generieren kann.

PythonOpenCVTensorFlowMediaPipe

D3

Data-Science-Bootcamp-Programm

Data Science Coach (neuefische GmbH) · Sep 2023 – Apr 2024

Professionelles Weiterbildungsprogramm zur Qualifizierung von Teilnehmenden für Data-Science-Karrieren.

Details
  • Durchführung von Vorlesungen zu Python, Machine Learning, SQL und Datenvisualisierung.
  • Mentoring der Teilnehmenden über den gesamten Data-Science-Lebenszyklus hinweg.
  • Betreuung von Capstone-Projekten und technischen Präsentationen.
  • Entwicklung und Weiterentwicklung von Schulungsmaterialien.

Erfolgreiche Begleitung mehrerer Kohorten beim Aufbau industrietauglicher Data-Science-Kompetenzen.

PythonPandasNumPyScikit-LearnTensorFlowSQLDockerdbtGoogle Cloud

Beratung

C1

Geldwäscheprävention – Know-Your-Customer-Plattform (KYC)

Lead Business Functional Analyst (Cintellic GmbH) · Aug 2024 – Jul 2025

Cloud-Migration und Entwicklung einer Analyse-Umgebung zur Erkennung von Finanzkriminalität bei einer großen internationalen Bank.

Details
  • Ausbau der Python-basierten Analyse-Umgebung in Google Cloud.
  • Migration bestehender SAS-Reporting-Workflows in Python-basierte Pipelines.
  • Evaluierung von BI-Funktionalitäten mit Looker und Vorbereitung des Datenmodells.
  • Stakeholder-Management und Anforderungsanalyse.
  • Unterstützung der AML-Risikoanalyse durch Ad-hoc-Untersuchungen von Kundenbeziehungen.

Ermöglichung der Überführung bestehender Reporting-Prozesse in eine skalierbare cloudbasierte Analyse-Umgebung.

Google Cloud PlatformBigQueryPythonSASLooker

C2

Hyperpersonalisierte digitale Kundenplattform

Lead Business Functional Analyst (Cintellic GmbH) · Mai 2024 – Okt 2024

Entwicklung eines Datenmodells zur Unterstützung hyperpersonalisierter Kundenkommunikation im Rahmen der Migration der Kundendaten-Infrastruktur auf Google Cloud.

Details
  • Anforderungsanalyse mit Stakeholdern aus Fachbereichen und Analytik.
  • Mapping von Datentabellen aus Bestandssystemen auf die neue Cloud-Architektur.
  • Unterstützung bei der Integration von über 1.000 analytischen Prozessen in die Cloud-Plattform.

Bereitstellung einer skalierbaren Daten-Infrastruktur für personalisierte Marketing-Initiativen.

Google Cloud PlatformBigQuerySQLPython

Publikationen

  • Erstautor: 6
  • Geteilte Erstautorenschaft: 3
  • Co-Autor: 6
  • Σ 15 Publikationen
015 2017201820192020202120222023202420252026
Kumulativ über Zeit · 15 Publikationen

336 Zitationen über 11 indexierte Arbeiten · meistzitiert 59 · Crossref, indikativ

11 begutachtete Publikationen (2 als Erstautor, 3 geteilte Erstautorenschaft, 6 als Co-Autor) sowie 3 Konferenzbeiträge als Erstautor, 2017–2021, in Strahlenbiophysik & Super-Resolution-Bildgebung der DNA-Reparatur.

Vollständige Liste: orcid.org/0009-0001-8784-1771 Google Scholar

Auszeichnungen & Zertifikate

Google Cloud Certified - Associate Cloud Engineer · 2024

Google Cloud

Ausgestellt Dez. 2024, gültig bis Dez. 2027.

DeGBS-Posterpreis · 2021

Deutsche Gesellschaft für Biologische Strahlenforschung

Auszeichnung „Most Patient-Centric Solution“ · 2018

{Life Science} meets IT Hackathon, Mannheim

DAAD-PROMOS-Stipendium · 2015

DAAD

Förderung des Forschungspraktikums an der Seoul National University (Bio & Health Informatics Lab) zur Splice-Junction-Neoantigen-Identifizierung.

Häufige Fragen

Wer ist Jin-Ho Lee?

Jin-Ho Lee ist Bioinformatiker und Data Scientist mit Sitz in Mannheim. Er entwickelt In-silico-Pipelines zur HLA-Typisierung und Neoantigen-Identifizierung aus NGS- und RNA-Seq-Daten von Krebspatienten und baut produktives Machine Learning auf der Google Cloud. Er hat einen M.Sc. in Molekularer Biotechnologie der Universität Heidelberg und 10+ peer-reviewed Publikationen.

Welchen beruflichen Hintergrund hat Jin-Ho Lee?

Jin-Ho Lee forschte acht Jahre als Doktorand und postgraduierter Forscher an FZ Jülich, KIP, NCT, SNU und DKFZ zu Krebsgenomik und hochauflösender Mikroskopie. Anschließend wechselte er in die Industrie als Data-Science-Coach bei neuefische und als Berater und Lead Business Functional Analyst für eine internationale Bank; heute arbeitet er unabhängig an ML/AI-Engineering und Open-Source-Tooling.

Welche technischen Fähigkeiten hat Jin-Ho Lee?

Jin-Ho Lee arbeitet mit Python, SQL und R, mit Machine Learning in PyTorch und TensorFlow, Bioinformatik-Pipelines in Snakemake sowie Cloud Data Engineering auf der Google Cloud inklusive BigQuery und BigQueryML. Seine Fachexpertise umfasst Krebsgenomik, NGS- und RNA-Seq-Analyse, HLA-Typisierung, Neoantigen-Identifizierung und räumliche Punktmusteranalyse.

Was hat Jin-Ho Lee publiziert?

Jin-Ho Lee hat 10+ peer-reviewed Publikationen, darunter Arbeiten als Erstautor und mit geteilter Erstautorschaft, in der Strahlenbiophysik und der hochauflösenden Bildgebung von DNA-Schadensreparatur und Chromatin-Architektur. Die vollständige Liste mit Zitationszahlen ist über seinen ORCID-Eintrag (0009-0001-8784-1771) und sein Google-Scholar-Profil verfügbar.

Woran arbeitet Jin-Ho Lee derzeit?

Jin-Ho Lee arbeitet derzeit unabhängig an agentischen KI-Systemen - LLM-Agenten mit Tool-Nutzung, Planung, Routing, Multi-Agenten-Orchestrierung und persistentem Speicher - sowie an Open-Source-Tooling für Claude Code, skelettbasierter Action Recognition in der Computer Vision und einer reproduzierbaren Snakemake-Pipeline zur Splice-Neoepitop-Identifizierung mit struktureller Validierung via AlphaFold2.

Ist Jin-Ho Lee für neue Positionen verfügbar?

Jin-Ho Lees erklärte Verfügbarkeit: offen für Positionen in Bioinformatik, Computational Biology und Data Science, mit Sitz in Mannheim. Der schnellste Weg, ihn zu erreichen, ist das Kontaktformular auf dieser Seite oder der Digital-Twin-Chat, der detaillierte Fragen zu seiner Erfahrung beantwortet und eine Nachricht weiterleiten kann.