Compruebe la calidad de la muestra en una matriz de cuenta de genes
Ejemplo práctico Compruebe la calidad de la muestra en GSE60450
Antes de realizar un análisis diferencial-expresión, compruebe que la matriz contable es estructuralmente usable y que las etiquetas de muestra siguen siendo rastreables. Este paseo utiliza el público real GEO GSE60450 mamaria del ratón RNA-seq Matriz. Produce una tabla QC de 12 muestras, una trama de tamaño libre y un informe de métodos en Open-Science.
Decisión de investigación: es el archivo internamente lo suficientemente consistente para proceder a la anotación de muestra y un análisis estadístico diseñado por separado? Los cheques de abajo dirección integridad del archivo y conteos descriptivos. No establecen comparabilidad biológica, normalización, corrección de lotes o expresión diferencial.
Las dimensiones y los resultados numéricos a continuación pertenecen a esta entrada de ejemplo. Con su propia matriz, defina sus columnas de muestra y vuelva a computar los cheques.
Contrato de fuentes e insumos
Descargar la matriz original de Datos de ejemplo y resultados esperados. Revise su chequesum, muestre columnas y campos de metadatos antes de subirlo. Utilice esa página para los valores de referencia a lo largo de este flujo de trabajo.
1. Define el trabajo antes de ejecutarlo
Crear un proyecto y adjuntar la matriz original de la página de ejemplo. Habilitar Python con csv, statistics y hashlib (librería estándar) e instalar matplotlib a través de Entornos de ejecución si está ausente. Utilice un modelo conectado que puede ejecutar código Notebook.
Enviar esta solicitud, o adaptar los nombres de salida al tiempo que preserva las definiciones de columna:
Inspect the attached public GEO GSE60450 gene-count matrix in the Session
Notebook using Python csv/statistics/hashlib and matplotlib. Do not install
packages during the analysis. Preserve the input. Exclude EntrezGeneID and
Length from the 12 sample-count columns. Validate unique IDs, row widths,
nonnegative integer counts and missing entries. Save rnaseq-sample-qc.csv
with exactly six columns: compact_sample, original_column_name, total_raw_counts,
zero_count_genes, detected_genes_count_gt_0, median_count_among_detected_genes. Retain the complete original sample
identifier in original_column_name; compact_sample is only a compact display label.
For each sample compute the raw-count sum, count of zeros, count > 0,
and median of positive counts. Save rnaseq-library-sizes.png with all sample
labels and a raw-count axis, plus rnaseq-qc-report.md describing the source,
input SHA-256 before and after, method, label mapping and limitations.
Save all three outputs in English; I will reopen them to check the results.
Do not perform differential-expression testing or delegate.
Antes de enviar, haga clic en el accesorio para comprobar su encabezado: dos columnas de metadatos seguidas por doce columnas de muestra. El texto previsualiza cargas sólo parte de un archivo grande; el Notebook debe leer toda la matriz. Esta ejecución envió el cálculo directamente. Si quieres estar de acuerdo en un plan primero, usa el flujo Planificación separado.

2. Mantener los metadatos fuera de los cálculos de muestras
El cálculo conserva IDs de Entrez, verifica los anchos de fila y cheques consistentes cuenta como enteros no negativos. Length es metadatos de genes, no una decimotercera muestra. Un recuento cero es una entrada medida, no un valor perdido; no reemplazar los blancos con cero o eliminar los genes de cuenta cero en silencio.
Para cada muestra, computar los recuentos totales brutos, número de genes de cuenta cero, número con cuenta mayor que cero, y la mediana cuenta entre los genes detectados solamente. Registre ese denominador. Use las columnas de entrada exactas; etiquetas compactas como MCL1-DG son etiquetas de visualización con una asignación explícita, no grupos biológicos recién inferidos.
3. Inspeccionar la ejecución y manejar un fracaso
Lea la solicitud de permiso Python, incluyendo el archivo de entrada y los nombres de salida, y luego permita la operación con alcance. Abrir Notebook en la conversación e inspeccionar la célula completa y su salida. Verifique las dimensiones, las etiquetas originales, los arrays métricos y antes/después del hash; el mensaje de finalización del modelo es insuficiente.
Si el ID de la versión de entrada no puede ser resuelto, pídale al agente que use la entrada montada del apego y la reingresación de esta conversación. Esta carrera usó esa recuperación. No trate el intento fallido como un cálculo completado o sustituya silenciosamente otro archivo.

La repetición completa validada filas de genes 27,179 y columnas de muestra 12 sin filas malformadas, IDs duplicadas, entradas faltantes o conteos inválidos. Los tres archivos solicitados aparecieron bajo Generated. Abra cada archivo allí; un archivo de trabajo que nunca fue guardado como un artefacto no es todavía un entregable.
4. Aceptar la tabla de la muestra
Abra rnaseq-sample-qc.csv y compruebe filas 12 · columnas 6. Retiene cada nombre de columna original completo. En el cuadro que figura a continuación se enumeran las cuatro métricas; el CSV descargable incluye la columna de asignación.
Compare todas las métricas de muestra con el Cuadro de referencia, hileras coincidentes por el identificador de muestra completo.

Para esta entrada, los genes detectados de cero cuenta más en cada fila deben igualar 27,179. Compare las métricas de la muestra 48 con la base de referencia independiente. El acuerdo comprueba estos cálculos para la entrada suministrada; Las hipótesis de abajo todavía necesitan su propia evaluación.
5. Lea la trama sin sobreinterpretarla
Abra rnaseq-library-sizes.png y agrandarla. Revise las doce etiquetas de muestra, el eje de cuenta cruda y la nota de que los valores no se normalizan. Los recuentos totales van desde 20,015,386 a 24,723,827 en esta matriz.

Un total de biblioteca más grande no significa por sí mismo que un gen se expresa de manera diferencial. Antes de un análisis de aguas abajo separadas, se combinan las características de la muestra con los metadatos GEO y se especifican el diseño, los contrastes, la normalización y las reglas de filtrado. Un seguimiento Connector separado recuperó las características GEO de las doce muestras; no se validaron las cartografías, el diseño de análisis y los pasos estadísticos de GSM a Mactrix. Ver Conectores.
6. Retener los métodos y las pruebas
Mantenga un informe que contenga el checksum de entrada, dimensiones, comprobaciones de validez, cartografía exacta de etiquetas, versiones de tiempo de ejecución/libración y límites de interpretación. Agregue una sección de control independiente sólo después de comparar los valores. Ahorrar una revisión del informe no recomputa el cuadro o la figura.
La repetición 16 de septiembre coincidió con todas las métricas 48 contra la base de referencia comprobada independientemente. Su entrada SHA-256 permaneció 128d2411f3169de0cac9963c30152bb5c9a3083ac80fd25651b97cf4b7304691. El informe registra Python 3.12.14 y matplotlib 3.11.1. Estos cheques establecen el acuerdo de este cálculo y la preservación de insumos; no establecen una auditoría de un examinador o un ambiente exacto para la reproducción independiente.
Descargar Cuadro QC, parcela y informe. Retener la entrada original y la sesión Notebook también. El ejemplo-página de datos mantiene por separado las exportaciones de referencia y Notebook anteriores; esas exportaciones no son el Notebook de esta repetición. Utilice Comprobaciones de reproducción para una evaluación separada del medio ambiente y la repetición.