Wissenschaftliche Instrumente
Führen Sie eine wissenschaftliche Berechnung erst dann durch, wenn die tatsächliche Eingabe- und Ausführungsumgebung klar ist. Wählen Sie einen lokalen Notebook, einen Connector oder einen externen Läufer entsprechend der Methode und ihren Abhängigkeiten.
Wählen Sie, wo die Berechnung läuft
| Route | Geeignete Arbeiten | Bereitschaftskontrolle |
|---|---|---|
| Python Sitzung Notebook | Datenparsing, numerische Zusammenfassungen und Plots | Gebundene Python-Laufzeit und installierte Pakete |
| R Sitzung Notebook | R Analyse und Pakete | R-Laufzeit, die an diese Sitzung gebunden ist |
| Eingebautes Connector | Datenbankabruf oder unterstützte deterministische Operation | Connector verfügbar für den Agenten, Anmeldeinformationen / Netzwerk nach Bedarf |
| Remote Compute | Hostspezifische Software, GPU oder Batch-Jobs | Förderfähiger Host, Umgebung und Zeitplaner |
Ein Shell-Befehl ist nicht mit einem Session Notebook-Lauf austauschbar: Ihre Laufzeit, Eingänge und Herkunft können sich unterscheiden. Fordern Sie die beabsichtigte Route explizit an.
Pakete und Abhängigkeiten
| Schritt | Was zu tun ist | Erfolgreiches Ergebnis |
|---|---|---|
| Inspektion | Fragen Sie nach inspect_packages in der vorgesehenen Sprache/Laufzeit | Installierter/fehlender Status und Versionen |
| Installieren | Verwenden Sie die unterstützte manage_packages Flow für die gebundene Umgebung | Abgeschlossene Installer-Ausgabe, nicht nur „Installation gestartet |
| Neustart | Neustart/Rebind des Kernels, wenn die App ihn anfordert | Die nächste Zelle verwendet die aktualisierte Umgebung |
| Prüfen | Importieren Sie das Paket in demselben Notebook | Aktuelle Version und ein kleiner Arbeitsbetrieb |
Wenn die Paketinstallation HTTP CONNECT 403 zurückgibt, überprüfen Sie den betroffenen Pakethostnamen und Netzwerkeinstellungen, bevor Sie erneut versuchen. Verwenden Sie ein vorhandenes Paket nur, wenn es die von Ihnen benötigte Methode unterstützt; Eine erfolgreiche Berechnung bedeutet nicht, dass eine ausgefallene Paketinstallation repariert wurde.
Ausführen und Verifizieren einer lokalen RNA-seq-Berechnung
Praxisbeispiel Überprüfen Sie die Anzahl der Sample-Level in der GSE60450-Matrix
- Befestigen Sie den GSE60450-Eingang.
- Wählen Sie die Laufzeit von Python oder R Notebook. Überprüfen Sie die Version, bevor Sie etwas installieren.
- Fragen Sie nach Vollmatrixdimension und Zählintegritätsprüfungen;
EntrezGeneIDundLengthaus den Probenspalten ausschließen. - Für jede vollständige Probenkennung sind die Gesamtzählung, die Nullzählungsgene, die nachgewiesenen Gene und der Median unter den nachgewiesenen Genen zu berechnen.
- Speichern Sie neue CSV, Diagramm und Methoden Bericht. Halten Sie die Quelle unverändert und vergleichen Sie ihre SHA-256 vorher / nachher.
- Öffnen Sie alle Outputs wieder. Stichprobenanzahl, Etiketten und Werte gegeneinander prüfen; Inspizieren Sie den aktuellen Notebook-Code und die Protokolle.
Vergleichen Sie Output-Identifier und Metriken mit dem Beispiel-Baseline. Halten Sie den Roh-Input unverändert. Deskriptive Zählungen stellen keine normalisierte Expression, differentielle Expression oder eine klinische Schlussfolgerung dar.
Python QC CSV · R/Python Vergleich · Skill Validierung.
Entwerfen einer kleinen Proteinsequenz auf CPU
Praxisbeispiel Design Candidate Sequenzen für das 1UBQ Backbone
Diese Route führt die offizielles ProteinMPNN CLI auf menschlichem Ubiquitin, PDB 1UBQ-Kette A. Es erstellt jeweils einen Kandidaten mit der Vanille und löslichen Checkpoints. Es handelt sich um eine umgekehrte Faltungsberechnung, die auf einem bestehenden Rückgrat basiert.
Bereiten Sie den Läufer und Gewichte
Verwenden Sie ein unterstütztes Python mit funktionierendem venv und Pip, Git, Internetzugang und einem beschreibbaren Ordner. Die folgenden Befehle sind für macOS/Linux Shells. Verwenden Sie auf Windows das entsprechende .venv\Scripts\python.exe und setzen Sie CUDA_VISIBLE_DEVICES mit der Syntax Ihrer Shell.
mkdir protein-design
cd protein-design
git clone https://github.com/dauparas/ProteinMPNN.git
git -C ProteinMPNN checkout 8907e6671bfbfc92303b5f79c4b5e6ce47cdef57
python3 -m venv .venv
.venv/bin/python -m pip install torch numpy
.venv/bin/python -c "import sys, torch, numpy; print(sys.version); print(torch.__version__, numpy.__version__)"
.venv/bin/python -m pip freeze > environment.txt
Die angeheftete Kasse enthält vanilla_model_weights/v_48_020.pt und soluble_model_weights/v_48_020.pt; bestätigen, dass beide Dateien vorhanden sind. Laden Sie das 1UBQ-Eingang als 1UBQ.pdb in protein-design herunter. Halten Sie die Sequenzeingabe von den Ausgabeordnern getrennt.
Dieses Setup installiert Pakete in einer externen virtuellen Umgebung. Wenn pip keine kompatible Verteilung meldet, wählen Sie eine Python-Version, die vom verfügbaren PyTorch-Rad unterstützt wird, bevor Sie es erneut versuchen. Datensatz environment.txt; Ändern Python, PyTorch oder NumPy kann numerische Ausgabe ändern. Wenn eine alte virtuelle Umgebung nach einem Systemupdate ihren Basis-Interpreter nicht mehr findet, erstellen Sie ihn mit dem aktuellen kompatiblen Python neu.
Führen Sie beide Modelle aus und speichern Sie ihre Ausgänge
Von protein-design, laufen:
CUDA_VISIBLE_DEVICES="" .venv/bin/python ProteinMPNN/protein_mpnn_run.py \
--pdb_path 1UBQ.pdb --pdb_path_chains A --model_name v_48_020 \
--num_seq_per_target 1 --batch_size 1 --sampling_temp 0.1 --seed 42 \
--out_folder outputs/vanilla
CUDA_VISIBLE_DEVICES="" .venv/bin/python ProteinMPNN/protein_mpnn_run.py \
--pdb_path 1UBQ.pdb --pdb_path_chains A --model_name v_48_020 \
--use_soluble_model --num_seq_per_target 1 --batch_size 1 \
--sampling_temp 0.1 --seed 42 --out_folder outputs/soluble
Beide Befehle verwenden Kette A, eine Sequenz, Temperatur 0.1 und Seed 42. Durch das Löschen der CUDA-Gerätesichtbarkeit wird dieser Läufer CPU verwenden. Erwarten Sie outputs/vanilla/seqs/1UBQ.fa und outputs/soluble/seqs/1UBQ.fa; ihre Namen beim Importieren oder Veröffentlichen getrennt halten.
Um über Open-Science auszuführen, geben Sie den vorbereiteten Ordner mit Your files → Grant folder… und bitten Sie den Agenten, diese Befehle mit dem absoluter Python-Pfad der Umgebung und diesem Arbeitsverzeichnis auszuführen. Prüfen Sie den Befehl und den Umfang bei der Genehmigung. Bitten Sie es, die beiden FASTAs und einen Vergleichsbericht zu veröffentlichen, und öffnen Sie dann alle drei in Files erneut. Eine Datei, die nur im Arbeitsverzeichnis verbleibt, muss noch veröffentlicht werden.
:::caution[Skill package loading] Wenn das integrierte Modell Skill die Paketpfadvalidierung nicht besteht, melden Sie diesen Fehler über Fehlerbehebung. Die oben genannte CLI-Route bleibt eine separate Methode; Eine erfolgreiche CLI-Ausführung stellt nicht sicher, dass das native Skill-Laden funktioniert. :::
Überprüfen Sie die entworfenen Sequenzen

Die gespeicherten Ausgänge in diesem Beispiel enthielten folgende Ergebnisse:
| Ausgabe | Konzipierte Rückstände | Score | Erholung gegen native |
|---|---|---|---|
| ProteinMPNN FASTA | 76 | 0.7883 | 55.26% |
| LöslicheMPNIN-FASTA | 76 | 0.7900 | 59.21% |
Jede FASTA enthält zwei Datensätze: zuerst die native Sequenz, dann den einzelnen designten Kandidaten. Unabhängige Kontrollen bestätigten kanonische Aminosäuren, 76-Rückstände pro Datensatz, endliche Werte, direkt recomputed Wiederfindung und unveränderte PDB SHA-256. Gespeicherte Artefaktbytes stimmten mit den Runner-Ausgaben überein. Der Vergleichsbericht zeichnet Einstellungen und Einschränkungen auf. Noten aus diesem Ein-Kandidaten-Vergleich legen nicht fest, welches Modell eine bessere Faltung, Löslichkeit oder Funktion ergibt.
Diagnose durch das scheiternde Stadium
| Symptom | Nächste Prüfung |
|---|---|
| Keine Laufzeit / R nicht verfügbar | Installieren oder aktivieren Sie den Dolmetscher durch LaufzeitenDann binden Sie es. |
| ImportError / ModuleNotFoundError / kein Paket aufgerufen | Überprüfen Sie die ausgewählte Umgebung und verwenden Sie die verwaltete Paketinstallation. |
| Unbekanntes Skill / ungültiger Kernel-Helfer | Unterscheiden Sie ein Methodenpaket von einem tatsächlichen aufrufbaren Notebook-Helfer. |
| Eingabeversion nicht verfügbar / Datei nicht gefunden | Lösen Sie die genaue aktuelle Eingabe durch die Anwendung; Erraten Sie keinen Weg. |
| Netzwerk-/HTTP-Ausfall | Host, Betrieb und Ist-Status beibehalten; Verwendung Netzsteuerung und Fehlerhinweise. |
| Output existiert nur in einem Arbeitsverzeichnis | Veröffentlichen Sie es über die unterstützte Artefaktroute und öffnen Sie die gespeicherte Version erneut. |
| Kein Producer Block / Partial Environment | die Beschränkung beibehalten; keine fehlenden Beweise anfertigen. |
Bei Remote-Jobs sind die Bereitschaft des Wirts, die Einreichung, der Status und die geerntete Leistung separat zu prüfen. Der Direct SSH RNA-seq Beispiel wurde fertiggestellt und seine Ausgänge wurden unabhängig überprüft. Die Überwachung des Slurm-Terminals erfordert eine lesbare Abrechnung. Das gleiche Kapitel dokumentiert nun einen verifizierten A100 ProteinMPNN-Lauf mit einer isolierten CUDA-Umgebung und unabhängigen Output-Checks. CPU-fähige Verfahren bleiben separat bewertbar.
Für unterstützte Langzeitarbeit folgen Sie Hintergrundaufgaben und Ergebnislieferung. Überprüfen Sie den tatsächlichen Lauf und die gespeicherten Ausgaben nach der Lieferung. Environment & Packages, Compute Environment Setup und Remote Compute (SSH) bleiben aktiviert, aber ihre Laufzeit-, Netzwerk- und Hostanforderungen gelten weiterhin.
Bezugsnummer der Durchführung: notebook.ts, SKILL.md, SKILL.md.