Zum Hauptinhalt springen

Wissenschaftliche Instrumente

Führen Sie eine wissenschaftliche Berechnung erst dann durch, wenn die tatsächliche Eingabe- und Ausführungsumgebung klar ist. Wählen Sie einen lokalen Notebook, einen Connector oder einen externen Läufer entsprechend der Methode und ihren Abhängigkeiten.

Wählen Sie, wo die Berechnung läuft

RouteGeeignete ArbeitenBereitschaftskontrolle
Python Sitzung NotebookDatenparsing, numerische Zusammenfassungen und PlotsGebundene Python-Laufzeit und installierte Pakete
R Sitzung NotebookR Analyse und PaketeR-Laufzeit, die an diese Sitzung gebunden ist
Eingebautes ConnectorDatenbankabruf oder unterstützte deterministische OperationConnector verfügbar für den Agenten, Anmeldeinformationen / Netzwerk nach Bedarf
Remote ComputeHostspezifische Software, GPU oder Batch-JobsFörderfähiger Host, Umgebung und Zeitplaner

Ein Shell-Befehl ist nicht mit einem Session Notebook-Lauf austauschbar: Ihre Laufzeit, Eingänge und Herkunft können sich unterscheiden. Fordern Sie die beabsichtigte Route explizit an.

Pakete und Abhängigkeiten

SchrittWas zu tun istErfolgreiches Ergebnis
InspektionFragen Sie nach inspect_packages in der vorgesehenen Sprache/LaufzeitInstallierter/fehlender Status und Versionen
InstallierenVerwenden Sie die unterstützte manage_packages Flow für die gebundene UmgebungAbgeschlossene Installer-Ausgabe, nicht nur „Installation gestartet
NeustartNeustart/Rebind des Kernels, wenn die App ihn anfordertDie nächste Zelle verwendet die aktualisierte Umgebung
PrüfenImportieren Sie das Paket in demselben NotebookAktuelle Version und ein kleiner Arbeitsbetrieb

Wenn die Paketinstallation HTTP CONNECT 403 zurückgibt, überprüfen Sie den betroffenen Pakethostnamen und Netzwerkeinstellungen, bevor Sie erneut versuchen. Verwenden Sie ein vorhandenes Paket nur, wenn es die von Ihnen benötigte Methode unterstützt; Eine erfolgreiche Berechnung bedeutet nicht, dass eine ausgefallene Paketinstallation repariert wurde.

Ausführen und Verifizieren einer lokalen RNA-seq-Berechnung

Praxisbeispiel Überprüfen Sie die Anzahl der Sample-Level in der GSE60450-Matrix

  1. Befestigen Sie den GSE60450-Eingang.
  2. Wählen Sie die Laufzeit von Python oder R Notebook. Überprüfen Sie die Version, bevor Sie etwas installieren.
  3. Fragen Sie nach Vollmatrixdimension und Zählintegritätsprüfungen; EntrezGeneID und Length aus den Probenspalten ausschließen.
  4. Für jede vollständige Probenkennung sind die Gesamtzählung, die Nullzählungsgene, die nachgewiesenen Gene und der Median unter den nachgewiesenen Genen zu berechnen.
  5. Speichern Sie neue CSV, Diagramm und Methoden Bericht. Halten Sie die Quelle unverändert und vergleichen Sie ihre SHA-256 vorher / nachher.
  6. Öffnen Sie alle Outputs wieder. Stichprobenanzahl, Etiketten und Werte gegeneinander prüfen; Inspizieren Sie den aktuellen Notebook-Code und die Protokolle.

Vergleichen Sie Output-Identifier und Metriken mit dem Beispiel-Baseline. Halten Sie den Roh-Input unverändert. Deskriptive Zählungen stellen keine normalisierte Expression, differentielle Expression oder eine klinische Schlussfolgerung dar.

Python QC CSV · R/Python Vergleich · Skill Validierung.

Entwerfen einer kleinen Proteinsequenz auf CPU

Praxisbeispiel Design Candidate Sequenzen für das 1UBQ Backbone

Diese Route führt die offizielles ProteinMPNN CLI auf menschlichem Ubiquitin, PDB 1UBQ-Kette A. Es erstellt jeweils einen Kandidaten mit der Vanille und löslichen Checkpoints. Es handelt sich um eine umgekehrte Faltungsberechnung, die auf einem bestehenden Rückgrat basiert.

Bereiten Sie den Läufer und Gewichte

Verwenden Sie ein unterstütztes Python mit funktionierendem venv und Pip, Git, Internetzugang und einem beschreibbaren Ordner. Die folgenden Befehle sind für macOS/Linux Shells. Verwenden Sie auf Windows das entsprechende .venv\Scripts\python.exe und setzen Sie CUDA_VISIBLE_DEVICES mit der Syntax Ihrer Shell.

mkdir protein-design
cd protein-design
git clone https://github.com/dauparas/ProteinMPNN.git
git -C ProteinMPNN checkout 8907e6671bfbfc92303b5f79c4b5e6ce47cdef57
python3 -m venv .venv
.venv/bin/python -m pip install torch numpy
.venv/bin/python -c "import sys, torch, numpy; print(sys.version); print(torch.__version__, numpy.__version__)"
.venv/bin/python -m pip freeze > environment.txt

Die angeheftete Kasse enthält vanilla_model_weights/v_48_020.pt und soluble_model_weights/v_48_020.pt; bestätigen, dass beide Dateien vorhanden sind. Laden Sie das 1UBQ-Eingang als 1UBQ.pdb in protein-design herunter. Halten Sie die Sequenzeingabe von den Ausgabeordnern getrennt.

Dieses Setup installiert Pakete in einer externen virtuellen Umgebung. Wenn pip keine kompatible Verteilung meldet, wählen Sie eine Python-Version, die vom verfügbaren PyTorch-Rad unterstützt wird, bevor Sie es erneut versuchen. Datensatz environment.txt; Ändern Python, PyTorch oder NumPy kann numerische Ausgabe ändern. Wenn eine alte virtuelle Umgebung nach einem Systemupdate ihren Basis-Interpreter nicht mehr findet, erstellen Sie ihn mit dem aktuellen kompatiblen Python neu.

Führen Sie beide Modelle aus und speichern Sie ihre Ausgänge

Von protein-design, laufen:

CUDA_VISIBLE_DEVICES="" .venv/bin/python ProteinMPNN/protein_mpnn_run.py \
--pdb_path 1UBQ.pdb --pdb_path_chains A --model_name v_48_020 \
--num_seq_per_target 1 --batch_size 1 --sampling_temp 0.1 --seed 42 \
--out_folder outputs/vanilla
CUDA_VISIBLE_DEVICES="" .venv/bin/python ProteinMPNN/protein_mpnn_run.py \
--pdb_path 1UBQ.pdb --pdb_path_chains A --model_name v_48_020 \
--use_soluble_model --num_seq_per_target 1 --batch_size 1 \
--sampling_temp 0.1 --seed 42 --out_folder outputs/soluble

Beide Befehle verwenden Kette A, eine Sequenz, Temperatur 0.1 und Seed 42. Durch das Löschen der CUDA-Gerätesichtbarkeit wird dieser Läufer CPU verwenden. Erwarten Sie outputs/vanilla/seqs/1UBQ.fa und outputs/soluble/seqs/1UBQ.fa; ihre Namen beim Importieren oder Veröffentlichen getrennt halten.

Um über Open-Science auszuführen, geben Sie den vorbereiteten Ordner mit Your files → Grant folder… und bitten Sie den Agenten, diese Befehle mit dem absoluter Python-Pfad der Umgebung und diesem Arbeitsverzeichnis auszuführen. Prüfen Sie den Befehl und den Umfang bei der Genehmigung. Bitten Sie es, die beiden FASTAs und einen Vergleichsbericht zu veröffentlichen, und öffnen Sie dann alle drei in Files erneut. Eine Datei, die nur im Arbeitsverzeichnis verbleibt, muss noch veröffentlicht werden.

:::caution[Skill package loading] Wenn das integrierte Modell Skill die Paketpfadvalidierung nicht besteht, melden Sie diesen Fehler über Fehlerbehebung. Die oben genannte CLI-Route bleibt eine separate Methode; Eine erfolgreiche CLI-Ausführung stellt nicht sicher, dass das native Skill-Laden funktioniert. :::

Überprüfen Sie die entworfenen Sequenzen

Abgeschlossener lokaler CPU-Lauf und erneut geöffneter Vergleichsbericht

Die gespeicherten Ausgänge in diesem Beispiel enthielten folgende Ergebnisse:

AusgabeKonzipierte RückständeScoreErholung gegen native
ProteinMPNN FASTA760.788355.26%
LöslicheMPNIN-FASTA760.790059.21%

Jede FASTA enthält zwei Datensätze: zuerst die native Sequenz, dann den einzelnen designten Kandidaten. Unabhängige Kontrollen bestätigten kanonische Aminosäuren, 76-Rückstände pro Datensatz, endliche Werte, direkt recomputed Wiederfindung und unveränderte PDB SHA-256. Gespeicherte Artefaktbytes stimmten mit den Runner-Ausgaben überein. Der Vergleichsbericht zeichnet Einstellungen und Einschränkungen auf. Noten aus diesem Ein-Kandidaten-Vergleich legen nicht fest, welches Modell eine bessere Faltung, Löslichkeit oder Funktion ergibt.

Diagnose durch das scheiternde Stadium

SymptomNächste Prüfung
Keine Laufzeit / R nicht verfügbarInstallieren oder aktivieren Sie den Dolmetscher durch LaufzeitenDann binden Sie es.
ImportError / ModuleNotFoundError / kein Paket aufgerufenÜberprüfen Sie die ausgewählte Umgebung und verwenden Sie die verwaltete Paketinstallation.
Unbekanntes Skill / ungültiger Kernel-HelferUnterscheiden Sie ein Methodenpaket von einem tatsächlichen aufrufbaren Notebook-Helfer.
Eingabeversion nicht verfügbar / Datei nicht gefundenLösen Sie die genaue aktuelle Eingabe durch die Anwendung; Erraten Sie keinen Weg.
Netzwerk-/HTTP-AusfallHost, Betrieb und Ist-Status beibehalten; Verwendung Netzsteuerung und Fehlerhinweise.
Output existiert nur in einem ArbeitsverzeichnisVeröffentlichen Sie es über die unterstützte Artefaktroute und öffnen Sie die gespeicherte Version erneut.
Kein Producer Block / Partial Environmentdie Beschränkung beibehalten; keine fehlenden Beweise anfertigen.

Bei Remote-Jobs sind die Bereitschaft des Wirts, die Einreichung, der Status und die geerntete Leistung separat zu prüfen. Der Direct SSH RNA-seq Beispiel wurde fertiggestellt und seine Ausgänge wurden unabhängig überprüft. Die Überwachung des Slurm-Terminals erfordert eine lesbare Abrechnung. Das gleiche Kapitel dokumentiert nun einen verifizierten A100 ProteinMPNN-Lauf mit einer isolierten CUDA-Umgebung und unabhängigen Output-Checks. CPU-fähige Verfahren bleiben separat bewertbar.

Für unterstützte Langzeitarbeit folgen Sie Hintergrundaufgaben und Ergebnislieferung. Überprüfen Sie den tatsächlichen Lauf und die gespeicherten Ausgaben nach der Lieferung. Environment & Packages, Compute Environment Setup und Remote Compute (SSH) bleiben aktiviert, aber ihre Laufzeit-, Netzwerk- und Hostanforderungen gelten weiterhin.

Bezugsnummer der Durchführung: notebook.ts, SKILL.md, SKILL.md.