Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
8 changes: 7 additions & 1 deletion Makefile
Original file line number Diff line number Diff line change
Expand Up @@ -9,7 +9,7 @@ PY := uv run python
evaluate-peptide-hla-rank-sensitivity build-fixed-sensitivities \
evaluate-exact-peptide-sensitivity evaluate-near-sensitivity \
evaluate-length-sensitivity manifest validate-metrics reproduce-results full-reproduce test \
verify-reproduction validate-literature status
verify-reproduction validate-literature status readme-i18n-status check-readme-i18n

install:
uv sync --extra dev --extra analysis
Expand Down Expand Up @@ -252,3 +252,9 @@ validate-literature:

status:
uv run neorepro status

readme-i18n-status:
$(PY) scripts/readme_i18n.py status

check-readme-i18n:
$(PY) scripts/readme_i18n.py check
51 changes: 51 additions & 0 deletions README.de.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,51 @@
[English](README.md) | [简体中文](README.zh-CN.md) | [繁體中文](README.zh-TW.md) | [日本語](README.ja.md) | [한국어](README.ko.md) | [Deutsch](README.de.md) | [Español](README.es.md) | [Français](README.fr.md)

# NeoRepro

NeoRepro ist eine reproduzierbare, patientenbezogene Benchmark-Ressource für öffentliche MHC-I-Peptid–HLA-Neoantigen-Prädiktoren unter Berücksichtigung von Datenlecks. Sie bündelt festgeschriebene Prädiktor-Artefakte, Provenienz auf Datensatzebene, Prüfungen auf Überschneidungen mit Trainingsdaten, Vergleiche auf einer gemeinsamen Auswertungsmenge, patientenbezogene Unsicherheit, an die Abdeckung angepasste Zufallsreferenzen und maschinell erzeugte Ergebnisse.

Der Beitrag ist eine Benchmark- und Forschungsressource, kein neuer Prädiktor und keine Behauptung eines universell besten Modells oder klinischen Nutzens.

## Einstieg

- **Aktuelles Manuskript:** [als Ressource positioniertes Manuskript](paper/manuscript_resource.md).
- **Evidenz in zwei Minuten:** [zweisprachige Expertenübersicht](output/pdf/neorepro_expert_brief_bilingual.pdf) und [Zusammenfassung der unabhängigen Kohortenerweiterung](reports/extension_summary.md).
- **Festgeschriebene Ergebnisse reproduzieren:** den Befehl im Abschnitt „Reproduktion“ verwenden.
- **Feste Version zitieren:** [CITATION.cff](CITATION.cff) und [v0.1.0 release](https://github.com/stevezkw1998/NeoRepro/releases/tag/v0.1.0).

Der wissenschaftliche Vertrag und Umfang stehen in [RESEARCH_SPEC.md](RESEARCH_SPEC.md).

## Status

- Aktuelle Literaturprüfung: abgeschlossen; Entscheidung `RESCOPE, then GO`
- Reproduzierte Prädiktoren: MHCflurry 2.2.1, BigMHC v1.0, PRIME 2.0, DeepImmuno-CNN und DeepHLApan
- TESLA-Pilot: abgeschlossen; als Positivkontrolle für Trainingsdatenüberschneidung neu eingestuft
- Primärer Benchmark: IMPROVE, 17,475 nach Leakage-Filterung verbleibende Datensätze, 70 Patienten, 3 Kohorten
- Primäre IMPROVE-Inferenz: abgeschlossen; 52,425 Vorhersagen fester Werkzeuge ohne fehlende Datensätze
- Manuskript: [Ressourcenfassung](paper/manuscript_resource.md), aus festgeschriebenen Ergebnisdateien erzeugt; unabhängige statistische und biologische Prüfung abgeschlossen

## Hauptergebnis

Die offizielle PRIME2-Ergänzung zeigte, dass alle 520 Datensätze der anfänglichen TESLA-Testmenge exakte Trainingsüberschneidungen waren; sie bleiben daher nur als Leakage-Positivkontrolle erhalten. Im auf exakte Überschneidungen gefilterten und nach Präsentation vorselektierten gemeinsamen IMPROVE-Benchmark erreichte PRIME eine AUROC von 0.597 und einen mittleren patientenbezogenen pMHC-Recall@20 von 0.260; BigMHC erreichte 0.546 beziehungsweise 0.146. In der unabhängigen Zhao-Impfkohorte betrug der patientenbezogene NDCG@5 für BigMHC 0.658 gegenüber einer an die Abdeckung angepassten Zufallsreferenz von 0.578. DeepHLApan erreichte 0.580 gegenüber 0.578, DeepImmuno-CNN bei 43.8% Abdeckung 0.755 gegenüber 0.759. Die Ergebnisse stützen einen prüfbaren, auf Aufgabe und Auswertungsmenge abgestimmten Bewertungsvertrag, keine universelle Rangliste.

## Reproduktion

[uv](https://docs.astral.sh/uv/) installieren und anschließend mit dem im Projekt festgeschriebenen CPython 3.11.15 alle Analysen, Abbildungen, Tabellen und Manuskriptartefakte aus den versionierten Benchmark- und Vorhersagedateien neu erzeugen:

```bash
make -j4 reproduce-results
```

Unabhängige bootstrap-Analysen werden von Make parallelisiert. Bei begrenzter CPU oder begrenztem Arbeitsspeicher `make reproduce-results` ohne `-j4` verwenden. `make -j4 full-reproduce` lädt zusätzlich die festgeschriebenen öffentlichen Quelldaten herunter und installiert bzw. startet die Prädiktoren Dritter. Dafür müssen die ausschließlich akademischen Bedingungen von BigMHC und PRIME ausdrücklich akzeptiert werden; außerdem sind mehrere GB Speicherplatz und eine deutlich längere Laufzeit erforderlich.

## Evidenzkette

- **Primärer wissenschaftlicher Nachweis:** [aktuelles Manuskript](paper/manuscript_resource.md), [Abschlussbericht](FINAL_REPORT.md) und [Prüfprotokoll](paper/reviewer_response.md).
- **Prüfbare Ausgaben:** [endgültige Ergebnistabelle](results/final_results.csv), [Abbildungen](results/figures/), [Prüfung auf Trainingsüberschneidungen](research/training_overlap_summary_improve.json) und [SHA-256-Manifest](results/manifest.json).
- **Publikationsplanung:** [Strategie für Zielzeitschriften](reports/target_venues_2026-08-20.md).

Die unabhängige Erweiterung um die Zhao 2026-Impfkohorte lässt sich mit `make -j4 extension` reproduzieren. Die kompakte Evidenzübersicht steht in [reports/extension_summary.md](reports/extension_summary.md), der vor der Inferenz festgeschriebene Studienvertrag in [research/extension_protocol.json](research/extension_protocol.json). Der externe Endpunkt ist ELISPOT nach der Impfung und Verabreichung peptidgepulster dendritischer Zellen; er darf nicht als natürliche Tumorpräsentation oder klinische Wirksamkeit interpretiert werden.

## Lizenz

Der ursprüngliche Code und die Dokumentation von NeoRepro stehen unter der MIT License. Für Prädiktoren und Datensätze Dritter gelten weiterhin deren eigene Bedingungen; die Aufnahme in die Studie bedeutet keine Erlaubnis zur Weiterverbreitung.
51 changes: 51 additions & 0 deletions README.es.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,51 @@
[English](README.md) | [简体中文](README.zh-CN.md) | [繁體中文](README.zh-TW.md) | [日本語](README.ja.md) | [한국어](README.ko.md) | [Deutsch](README.de.md) | [Español](README.es.md) | [Français](README.fr.md)

# NeoRepro

NeoRepro es un recurso de evaluación reproducible, sensible a la fuga de datos y a nivel de paciente para predictores públicos de neoantígenos péptido–HLA de MHC-I. Reúne artefactos de predictores fijados, procedencia por registro, auditorías de solapamiento con datos de entrenamiento, comparaciones sobre soporte común, incertidumbre a nivel de paciente, referencias aleatorias ajustadas al soporte y resultados generados automáticamente.

Es una contribución de referencia y recursos, no un predictor nuevo ni una afirmación de que exista un modelo universalmente ganador o de utilidad clínica.

## Por dónde empezar

- **Manuscrito actual:** [manuscrito orientado como recurso](paper/manuscript_resource.md).
- **Resumen de la evidencia en dos minutos:** [informe bilingüe para expertos](output/pdf/neorepro_expert_brief_bilingual.pdf) y [resumen de la extensión con cohorte independiente](reports/extension_summary.md).
- **Reproducir los resultados fijados:** usar el comando de la sección «Reproducción».
- **Citar una versión fija:** [CITATION.cff](CITATION.cff) y [v0.1.0 release](https://github.com/stevezkw1998/NeoRepro/releases/tag/v0.1.0).

El contrato científico y el alcance están en [RESEARCH_SPEC.md](RESEARCH_SPEC.md).

## Estado

- Auditoría de la literatura actual: completa; decisión `RESCOPE, then GO`
- Predictores reproducidos: MHCflurry 2.2.1, BigMHC v1.0, PRIME 2.0, DeepImmuno-CNN y DeepHLApan
- Piloto TESLA: completo; reclasificado como control positivo de solapamiento con entrenamiento
- Evaluación principal: IMPROVE, 17,475 registros tras filtrar fugas, 70 pacientes y 3 cohortes
- Inferencia principal de IMPROVE: completa; 52,425 predicciones de herramientas fijas sin registros ausentes
- Manuscrito: [versión orientada como recurso](paper/manuscript_resource.md), generada a partir de resultados fijados; revisión estadística y biológica independiente completada

## Resultado principal

El suplemento oficial de PRIME2 mostró que los 520 registros del conjunto TESLA inicial eran solapamientos exactos con el entrenamiento, por lo que se conservan únicamente como control positivo de fuga. En la evaluación IMPROVE de soporte común, filtrada por solapamiento exacto y preseleccionada por presentación, PRIME obtuvo una AUROC de 0.597 y un Recall@20 medio paciente-pMHC de 0.260; BigMHC obtuvo 0.546 y 0.146. En la cohorte independiente de vacunación de Zhao, el NDCG@5 por paciente de BigMHC fue 0.658 frente a una referencia aleatoria ajustada al soporte de 0.578. DeepHLApan obtuvo 0.580 frente a 0.578, y DeepImmuno-CNN 0.755 frente a 0.759 con una cobertura del 43.8%. Estos resultados respaldan un contrato de evaluación auditable y consciente de la tarea y del soporte, no una clasificación universal.

## Reproducción

Instale [uv](https://docs.astral.sh/uv/) y reconstruya todos los análisis, figuras, tablas y artefactos del manuscrito con CPython 3.11.15 fijado por el proyecto y los archivos versionados de evaluación y predicción:

```bash
make -j4 reproduce-results
```

Make paraleliza los análisis bootstrap independientes. Use `make reproduce-results` sin `-j4` si la CPU o la memoria son limitadas. `make -j4 full-reproduce` también descarga los datos públicos fijados e instala y ejecuta predictores de terceros. Requiere aceptar expresamente las condiciones de uso exclusivamente académico de BigMHC y PRIME, varios GB de espacio en disco y un tiempo de ejecución considerablemente mayor.

## Cadena de evidencia

- **Registro científico principal:** [manuscrito actual](paper/manuscript_resource.md), [informe final](FINAL_REPORT.md) y [registro de revisión](paper/reviewer_response.md).
- **Resultados auditables:** [tabla final de resultados](results/final_results.csv), [figuras](results/figures/), [auditoría de solapamiento con entrenamiento](research/training_overlap_summary_improve.json) y [manifiesto SHA-256](results/manifest.json).
- **Planificación del envío:** [estrategia de revistas objetivo](reports/target_venues_2026-08-20.md).

La extensión independiente con la cohorte de vacunación Zhao 2026 se reproduce con `make -j4 extension`. El resumen conciso de la evidencia está en [reports/extension_summary.md](reports/extension_summary.md), y el contrato congelado antes de la inferencia en [research/extension_protocol.json](research/extension_protocol.json). El criterio externo es ELISPOT posterior a la vacunación tras administrar células dendríticas pulsadas con péptidos; no debe interpretarse como presentación tumoral natural ni eficacia clínica.

## Licencia

El código y la documentación originales de NeoRepro utilizan la MIT License. Los predictores y conjuntos de datos de terceros conservan sus propias condiciones; su inclusión en el estudio no implica permiso de redistribución.
51 changes: 51 additions & 0 deletions README.fr.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,51 @@
[English](README.md) | [简体中文](README.zh-CN.md) | [繁體中文](README.zh-TW.md) | [日本語](README.ja.md) | [한국어](README.ko.md) | [Deutsch](README.de.md) | [Español](README.es.md) | [Français](README.fr.md)

# NeoRepro

NeoRepro est une ressource d’évaluation reproductible, tenant compte des fuites de données et menée au niveau du patient, pour les prédicteurs publics de néoantigènes peptide–HLA de MHC-I. Elle rassemble des artefacts de prédicteurs épinglés, la provenance de chaque enregistrement, des audits de chevauchement avec les données d’entraînement, des comparaisons sur un support commun, l’incertitude au niveau du patient, des références aléatoires adaptées au support et des résultats générés automatiquement.

Il s’agit d’une contribution de type ressource et benchmark, et non d’un nouveau prédicteur ni d’une affirmation concernant un modèle universellement gagnant ou une utilité clinique.

## Pour commencer

- **Manuscrit actuel :** [manuscrit positionné comme ressource](paper/manuscript_resource.md).
- **Synthèse des preuves en deux minutes :** [note bilingue pour experts](output/pdf/neorepro_expert_brief_bilingual.pdf) et [résumé de l’extension sur une cohorte indépendante](reports/extension_summary.md).
- **Reproduire les résultats figés :** utiliser la commande de la section « Reproduction » ci-dessous.
- **Citer une version figée :** [CITATION.cff](CITATION.cff) et [v0.1.0 release](https://github.com/stevezkw1998/NeoRepro/releases/tag/v0.1.0).

Le contrat scientifique et le périmètre sont décrits dans [RESEARCH_SPEC.md](RESEARCH_SPEC.md).

## État

- Audit de la littérature actuelle : terminé ; décision `RESCOPE, then GO`
- Prédicteurs reproduits : MHCflurry 2.2.1, BigMHC v1.0, PRIME 2.0, DeepImmuno-CNN et DeepHLApan
- Pilote TESLA : terminé ; reclassé comme contrôle positif de chevauchement avec l’entraînement
- Benchmark principal : IMPROVE, 17,475 enregistrements après filtrage des fuites, 70 patients et 3 cohortes
- Inférence IMPROVE principale : terminée ; 52,425 prédictions d’outils fixes sans enregistrement manquant
- Manuscrit : [version positionnée comme ressource](paper/manuscript_resource.md), générée à partir des résultats figés ; revues statistique et biologique indépendantes terminées

## Résultat principal

Le supplément officiel de PRIME2 a montré que les 520 enregistrements du jeu TESLA initial correspondaient exactement aux données d’entraînement ; ils ne sont donc conservés que comme contrôle positif de fuite. Sur le benchmark commun IMPROVE, filtré pour exclure les chevauchements exacts et présélectionné selon la présentation, PRIME a obtenu une AUROC de 0.597 et un Recall@20 patient-pMHC moyen de 0.260 ; BigMHC a obtenu respectivement 0.546 et 0.146. Dans la cohorte vaccinale indépendante de Zhao, le NDCG@5 par patient de BigMHC était de 0.658, contre une référence aléatoire adaptée au support de 0.578. DeepHLApan obtenait 0.580 contre 0.578, et DeepImmuno-CNN 0.755 contre 0.759 avec une couverture de 43.8%. Ces résultats soutiennent un contrat d’évaluation auditable, explicite sur la tâche et le support, et non un classement universel.

## Reproduction

Installez [uv](https://docs.astral.sh/uv/), puis reconstruisez toutes les analyses, figures, tables et tous les artefacts du manuscrit avec CPython 3.11.15 épinglé par le projet et les fichiers de benchmark et de prédiction versionnés :

```bash
make -j4 reproduce-results
```

Make parallélise les analyses bootstrap indépendantes. Utilisez `make reproduce-results` sans `-j4` si les ressources CPU ou mémoire sont limitées. `make -j4 full-reproduce` télécharge également les données sources publiques épinglées, puis installe et exécute les prédicteurs tiers. Cette commande exige l’acceptation explicite des conditions d’utilisation académique de BigMHC et PRIME, plusieurs GB d’espace disque et une durée d’exécution nettement supérieure.

## Chaîne de preuves

- **Dossier scientifique principal :** [manuscrit actuel](paper/manuscript_resource.md), [rapport final](FINAL_REPORT.md) et [dossier de revue](paper/reviewer_response.md).
- **Sorties auditables :** [table finale des résultats](results/final_results.csv), [figures](results/figures/), [audit du chevauchement avec l’entraînement](research/training_overlap_summary_improve.json) et [manifeste SHA-256](results/manifest.json).
- **Planification de la soumission :** [stratégie des revues cibles](reports/target_venues_2026-08-20.md).

L’extension indépendante sur la cohorte vaccinale Zhao 2026 est reproduite avec `make -j4 extension`. La synthèse concise des preuves se trouve dans [reports/extension_summary.md](reports/extension_summary.md), et le contrat figé avant l’inférence dans [research/extension_protocol.json](research/extension_protocol.json). Le critère externe est un ELISPOT après vaccination et administration de cellules dendritiques chargées en peptides ; il ne doit pas être interprété comme une présentation tumorale naturelle ni comme une efficacité clinique.

## Licence

Le code et la documentation d’origine de NeoRepro utilisent la MIT License. Les prédicteurs et jeux de données tiers restent soumis à leurs propres conditions ; leur inclusion dans l’étude n’implique pas une autorisation de redistribution.
Loading
Loading