Universitat Internacional de Catalunya
Habilidades Computacionales Básicas para la Bioinformática
Otras lenguas de impartición: catalán, castellano
Profesorado
Las dudas podrán resolverse presencialmente o por videoconferencia con la coordinación de la asignatura o con el profesor correspondiente. El alumnado deberá contactar previamente con el profesor para concertar una cita.
Presentación
Esta asignatura introduce las competencias computacionales esenciales para la bioinformática y el uso práctico de las bases de datos biomédicas. El alumnado aprenderá a trabajar en entornos de línea de comandos, organizar datos biológicos, escribir scripts básicos en Python y Bash, y desarrollar flujos de trabajo computacionales claros y reproducibles.
La asignatura también ofrece experiencia práctica en la búsqueda, evaluación e integración de información procedente de las principales bases de datos biomédicas. El alumnado trabajará con recursos relacionados con nucleótidos, genes, expresión génica, proteínas, variación genética, enfermedades y fármacos, y los aplicará a cuestiones biomédicas realistas.
Los ejercicios guiados y las actividades basadas en casos ayudarán al alumnado a traducir preguntas biológicas en tareas computacionales, seleccionar las fuentes de datos adecuadas, interpretar los resultados y documentar el proceso de análisis.
Se podrán utilizar herramientas de programación asistida por inteligencia artificial para facilitar la generación, explicación y depuración de código. Se prestará especial atención a la definición del objetivo analítico, la revisión crítica del código generado, la comprobación de su funcionamiento, la validación de los resultados y la documentación del flujo de trabajo final.
La asignatura contribuye principalmente al ODS 3 (Salud y bienestar), al ODS 4 (Educación de calidad) y al ODS 9 (Industria, innovación e infraestructura), mediante el fortalecimiento de la alfabetización computacional, las prácticas de investigación reproducible y el uso responsable de herramientas digitales en la investigación biomédica.
Requisitos previos
Se recomienda que el alumnado haya cursado previamente las asignaturas Introducción a la Bioinformática e Interacciones Biomoleculares.
No se requiere experiencia previa en programación. Sin embargo, el alumnado debe estar familiarizado con el uso básico de ordenadores, incluido el manejo de archivos, carpetas y aplicaciones web habituales.
Objetivos
- Proporcionar al alumnado los conocimientos computacionales fundamentales necesarios para trabajar con datos biológicos y biomédicos mediante herramientas de línea de comandos y scripts básicos.
- Desarrollar competencias iniciales de programación en Python y Bash mediante ejercicios prácticos guiados que fomenten la creación de código legible, modular, bien documentado y reproducible.
- Familiarizar al alumnado con las principales bases de datos biomédicas y ayudarle a comprender su organización, alcance, limitaciones y uso adecuado en la investigación biomédica.
- Fortalecer el pensamiento crítico y la capacidad para resolver problemas, guiando al alumnado en el diseño, la documentación, la verificación y la evaluación de flujos de trabajo computacionales y de sus resultados.
- Promover prácticas computacionales responsables y colaborativas, incluido el uso crítico de herramientas de programación asistida por inteligencia artificial, y mostrar cómo los enfoques computacionales pueden conectar los datos moleculares con la investigación clínica y traslacional.
Competencias/Resultados de aprendizaje de la titulación
- CN14 - Identificar los principios de las ciencias biomédicas relacionados con la salud, así como los conceptos básicos y herramientas que tienen un impacto en las ciencias biomédicas y permiten trabajar en cualquiera de sus ámbitos (empresa biomédica, laboratorios de bioinformática, laboratorios de investigación, empresa de análisis clínicos, etc.).
- CP05 - Aplicar los fundamentos biológicos en la búsqueda de soluciones prácticas a problemas en el ámbito de la salud, siguiendo las normas éticas y de rigor científico y respetando los derechos fundamentales de igualdad entre hombres y mujeres, y la promoción de los derechos humanos y los valores propios de una cultura de paz y de valores democráticos que incluyen el fomento de un lenguaje inclusivo, no discriminatorio y libre de estereotipos.
Resultados de aprendizaje de la asignatura
Al finalizar la asignatura, el alumnado será capaz de:
- Utilizar herramientas de línea de comandos para trabajar en entornos computacionales, gestionar y procesar datos biológicos, y documentar las distintas etapas de un flujo de trabajo reproducible.
- Escribir, adaptar, depurar y probar scripts básicos en Python y Bash para tareas de procesamiento de datos claramente definidas, incluida la revisión crítica del código generado mediante inteligencia artificial.
- Seleccionar bases de datos biomédicas adecuadas y obtener datos mediante interfaces web, formatos de archivo habituales y consultas básicas a API.
- Interpretar e integrar información procedente de recursos sobre nucleótidos, expresión génica, proteínas, variación genética, enfermedades y farmacología para responder a preguntas biomédicas definidas.
- Organizar un pequeño proyecto de bioinformática utilizando estructuras de archivos claras, control de versiones, documentación adecuada y principios de colaboración y reproducibilidad.
- Evaluar la procedencia, calidad, coherencia y limitaciones de los datos biomédicos y de los resultados computacionales, y comunicar las conclusiones dentro del contexto biomédico correspondiente.
Contenidos
Descripción breve:
El temario se organiza en dos partes complementarias. La primera desarrolla competencias fundamentales en el uso de la línea de comandos, la programación en Python y Bash, el manejo de archivos biológicos, las API, el control de versiones, la reproducibilidad y el uso crítico de herramientas de programación asistida por inteligencia artificial. La segunda parte aplica estas competencias a la exploración y evaluación de las principales bases de datos biomédicas mediante ejercicios guiados y actividades basadas en casos.
CAPÍTULO 1: FUNDAMENTOS DE PROGRAMACIÓN Y COMPUTACIÓN (15 HORAS)
1.1 Entornos computacionales y línea de comandos (3 horas)
-
Navegación por sistemas de archivos y gestión de archivos y carpetas
-
Permisos y control de acceso
-
Pipes, encadenamiento de comandos y herramientas de procesamiento de texto: cat, grep, awk y sed
-
Trabajo con entornos de datos locales y en la nube
1.2 Fundamentos de programación en Python y Bash (3 horas)
-
Sintaxis básica y tipos de datos en Python
-
Variables, condiciones y bucles
-
Listas, diccionarios y scripts básicos de shell
-
Descomposición de preguntas biomédicas en tareas computacionales
1.3 Formatos de archivos biomédicos, procesamiento de datos y API (3 horas)
-
Formatos habituales de datos biomédicos: FASTA, GTF/GFF, VCF, CSV/TSV y JSON
-
Lectura, escritura y transformación de datos tabulares
-
Introducción a las API y al acceso remoto a datos
-
Obtención de datos mediante consultas básicas a API
1.4 Código modular y fiable (3 horas)
-
Definición y utilización de funciones
-
Organización del código en módulos
-
Nomenclatura, comentarios y documentación del código
-
Depuración y gestión de errores
-
Pruebas básicas y validación de resultados
1.5 Flujos de trabajo reproducibles y programación asistida por IA (3 horas)
-
Organización y documentación de proyectos
-
Introducción a Git y al control de versiones
-
Uso crítico de herramientas asistidas por IA para generar, explicar y depurar código
-
Comprobación, validación y documentación del código generado mediante IA
-
Miniproyecto en grupo: desarrollo de un flujo de trabajo de datos reproducible
CAPÍTULO 2: BASES DE DATOS BIOMÉDICAS Y FUENTES DE DATOS (15 HORAS)
2.1 Comprender las bases de datos biomédicas (3 horas)
-
Principales tipos de datos biomédicos
-
Organización de las bases de datos, identificadores y referencias cruzadas
-
Curación, procedencia, versiones, calidad y limitaciones de los datos
-
Introducción a los principales portales: NCBI, EMBL-EBI, Ensembl y UniProt
2.2 De los nucleótidos a los genes y genomas (3 horas)
-
Recursos de nucleótidos y secuencias: GenBank, RefSeq y ENA
-
Recursos de información génica: NCBI Gene, Ensembl y GeneCards
-
Exploración de genomas mediante UCSC Genome Browser
-
Nomenclatura génica mediante HGNC
-
Obtención de secuencias y referencias cruzadas entre bases de datos
2.3 Expresión y regulación génica (3 horas)
-
Recursos de expresión génica: GEO y Expression Atlas
-
Datos de célula única mediante Single Cell Expression Atlas
-
Recursos de regulación y expresión tisular: GTEx y ENCODE
-
Interpretación de perfiles de expresión y de su contexto biológico
2.4 Secuencias, funciones e interacciones de proteínas (3 horas)
-
Recursos de secuencias proteicas: UniProt y RefSeq
-
Anotación funcional: InterPro, Pfam y PROSITE
-
Recursos de interacciones proteína-proteína: STRING, IntAct y BioGRID
-
Interpretación crítica de interacciones predichas y respaldadas experimentalmente
2.5 Variación genética, enfermedades y recursos farmacológicos (3 horas)
-
Recursos de variación genética: ClinVar, gnomAD y dbSNP
-
Recursos relacionados con enfermedades: OMIM y Orphanet
-
Recursos farmacogenómicos y farmacológicos: ClinPGx, DrugBank y PubChem
-
Integración de información molecular, patológica y farmacológica en un caso biomédico
-
Evaluación de la evidencia, la calidad de los datos y las limitaciones de las bases de datos
Metodología y actividades formativas
Modalidad totalmente presencial en el aula
Presencial
Modalidad docente totalmente presencial
Clases magistrales – 18 horas: Sesiones interactivas en el aula en las que el profesorado introduce los conceptos fundamentales y demuestra métodos computacionales, herramientas y bases de datos mediante ejemplos prácticos. Las sesiones podrán incluir ejercicios guiados breves para reforzar la aplicación práctica de los contenidos.
Método del caso (MC) – 12 horas: El alumnado, trabajando en grupos, aborda problemas prácticos basados en casos biomédicos y bioinformáticos mediante los datos, scripts y bases de datos presentados durante la asignatura. Cada grupo identifica los recursos adecuados, desarrolla un flujo de trabajo documentado, interpreta los resultados, y presenta y justifica sus conclusiones. El profesorado guía el debate, proporciona retroalimentación e introduce conceptos adicionales cuando resulta necesario.
Sistemas y criterios de evaluación
Modalidad totalmente presencial en el aula
Modalidad docente totalmente presencial
Alumnado en primera convocatoria:
-
Examen parcial tipo test: 30 %
-
Examen final tipo test: 40 %
-
Actividades del Método del Caso: 30 %
Los exámenes podrán evaluar la comprensión conceptual, la interpretación de código, la identificación de errores, la selección de formatos de archivo y bases de datos adecuados, el diseño de flujos de trabajo y la interpretación de resultados computacionales y biomédicos.
Alumnado en segunda convocatoria o convocatorias posteriores:
Se conservará la calificación obtenida en las actividades del Método del Caso. El examen final representará el 70 % de la calificación final.
El alumnado que repita la asignatura y desee volver a realizar el examen parcial en la tercera o quinta convocatoria podrá hacerlo siempre que lo comunique previamente a la coordinación de la asignatura.
Criterios generales de evaluación:
-
Para calcular la media ponderada será necesario obtener una calificación mínima de 5 sobre 10 en el examen final. La calificación global mínima para superar la asignatura será de 5 sobre 10.
-
Las preguntas tipo test tendrán cuatro respuestas posibles. Cada respuesta correcta sumará un punto, cada respuesta incorrecta restará 0,33 puntos y las preguntas no contestadas recibirán cero puntos.
-
Las actividades del Método del Caso se evaluarán teniendo en cuenta la adecuación de las herramientas y fuentes de datos seleccionadas, la corrección y reproducibilidad del flujo de trabajo, la calidad del análisis y de la interpretación crítica, la claridad de la documentación y de la presentación, y la contribución del estudiante al trabajo en grupo.
-
Debido al carácter de evaluación continua de la asignatura, el alumnado deberá asistir como mínimo al 75 % del total de las horas presenciales programadas.
-
El plagio, el intercambio no autorizado de código o resultados y el uso no declarado o no autorizado de herramientas de IA en actividades evaluables podrán considerarse conductas académicas indebidas. El uso de herramientas asistidas por IA deberá seguir las instrucciones establecidas para cada actividad y declararse cuando así se solicite.
-
Los dispositivos electrónicos solo podrán utilizarse con fines educativos durante las clases. No se permite grabar ni compartir imágenes, audio o vídeo del alumnado o del profesorado sin autorización. Estas conductas podrán conllevar la expulsión de la sesión y la aplicación de la normativa universitaria correspondiente.
Bibliografía y recursos
-
Python Software Foundation. The Python Tutorial – Python 3 Documentation. https://docs.python.org/3/tutorial/
-
Python Software Foundation. The Python Standard Library. https://docs.python.org/3/library/
-
Matthes, E. (2022). Python Crash Course: A Hands-On, Project-Based Introduction to Programming (3rd ed.). No Starch Press. https://nostarch.com/python-crash-course-3rd-edition
-
Software Carpentry. Programming with Python. https://swcarpentry.github.io/python-novice-inflammation/
-
GNU Project. Bash Reference Manual. https://www.gnu.org/software/bash/manual/
-
Chacon, S., & Straub, B. (2014). Pro Git (2nd ed.). Apress. https://git-scm.com/book/en/v2
-
Biopython Project. Biopython Tutorial and Cookbook. https://biopython.org/wiki/Documentation
-
NCBI. Tutorials and Educational Resources. https://www.ncbi.nlm.nih.gov/home/tutorials/
-
EMBL-EBI Training. Introductory Bioinformatics Pathway. https://www.ebi.ac.uk/training/online/courses/introductory-bioinformatics-pathway
-
Ensembl. Tutorials and Worked Examples. https://www.ensembl.org/info/website/tutorials/
-
UniProt. Help and Documentation. https://www.uniprot.org/help/
-
Buffalo, V. (2015). Bioinformatics Data Skills: Reproducible and Robust Research with Open Source Tools. O’Reilly Media.
Additional documentation and tutorials for the databases covered during the course will be provided through Moodle.