Universitat Internacional de Catalunya
Big Data e Inteligencia Artificial
Otras lenguas de impartición: inglés, castellano,
Presentación
La asignatura de Big Data e Inteligencia Artificial está diseñada para proporcionar a los estudiantes una comprensión integral de dos pilares complementarios del desarrollo moderno basado en datos: el aprendizaje automático (*machine learning*) y la ingeniería de datos a gran escala.
En el componente de Inteligencia Artificial, los estudiantes adquirirán una sólida base teórica y práctica en modelado predictivo. Partiendo de los modelos lineales y la teoría del aprendizaje estadístico, el curso avanza a través de máquinas de vectores de soporte, el algoritmo de los k-vecinos más cercanos, árboles de decisión, bosques aleatorios y redes neuronales, incluyendo un módulo específico sobre la interpretabilidad de los modelos para garantizar que las predicciones puedan comprenderse, auditarse y generar confianza en implementaciones del mundo real.
En el componente de Big Data, los estudiantes explorarán las herramientas y procesos utilizados para gestionar y procesar grandes volúmenes de datos en entornos distribuidos. Mediante el estudio de tecnologías como Hadoop, Spark y Kafka, aprenderán a construir sistemas escalables y resilientes, capaces de manejar conjuntos de datos masivos con alta disponibilidad y tolerancia a fallos. El curso también abordará los procesos ETL (extracción, transformación y carga), el almacenamiento eficiente de datos y el procesamiento en tiempo real utilizando herramientas como Apache Flink y Spark Streaming. Finalmente, se profundizará en conceptos clave como la seguridad y la gobernanza de datos, con especial atención a marcos normativos como el RGPD (GDPR) y la CCPA, ofreciendo una visión integral de los desafíos y soluciones dentro del ecosistema de Big Data.
Objetivos
Construir una base teórica en modelado predictivo: Comprender el marco de aprendizaje estadístico, el equilibrio entre sesgo y varianza y los principios de selección de modelos que sustentan todos los algoritmos supervisados y no supervisados.
Dominar los algoritmos fundamentales de aprendizaje automático (ML): Adquirir conocimientos prácticos sobre modelos lineales, SVM, KNN, árboles de decisión, bosques aleatorios y redes neuronales, incluyendo sus supuestos, fortalezas y limitaciones.
Desarrollar habilidades de interpretabilidad: Aprender a explicar y auditar las predicciones de los modelos utilizando técnicas como la importancia de las características (*feature importance*) y los valores SHAP, para permitir el despliegue responsable de sistemas de ML.
Comprender la arquitectura de Big Data: Conocer las tecnologías clave (Hadoop, Spark, Kafka) y cómo construir sistemas distribuidos escalables y tolerantes a fallos.
Dominar técnicas de procesamiento de datos: Adquirir experiencia en procesos ETL, MapReduce, Apache Spark y procesamiento de datos en tiempo real con Spark Streaming y Apache Flink.
Explorar soluciones de almacenamiento de Big Data: Estudiar arquitecturas de almacenamiento eficientes que permitan un acceso rápido a grandes volúmenes de datos.
Implementar seguridad y gobernanza de datos: Comprender la privacidad de los datos y el cumplimiento de normativas como el GDPR y la CCPA.
Aplicar conocimientos prácticos: Diseñar e implementar soluciones de Big Data para entornos reales que sean escalables, seguras y eficientes.
Competencias/Resultados de aprendizaje de la titulación
- CN01 - Describir los aspectos avanzados de la bioingeniería relacionados con la salud humana basándose en libros específicos de la materia juntamente con publicaciones científicas en la frontera del conocimiento
- CN04 - Comparar los distintos enfoques de la computación y análisis de datos en la gestión de señales biomédicas.
- CN05 - Explicar los principios de la bioingeniería empleados en el diseño y la fabricación de nuevas terapias de medicina personalizada.
- CN06 - Identificar los pasos y desarrollos necesarios para el correcto procesamiento de dispositivos médicos basándose en los datos médicos disponibles.
- CP01 - Interpretar los resultados científicos (tanto teóricos como prácticos) para emitir juicios con una reflexión crítica teniendo en cuenta conceptos de índole social, científica o ética.
- CP02 - Trabajar en un equipo multidisciplinar de manera proactiva, tomando consciencia del rol a desarrollar.
- CP06 - Producir tecnologías y productos aplicando los principios únicos de la bioingeniería para cada uso sanitario determinado, respetando los derechos fundamentales de igualdad entre hombres y mujeres, y la promoción de los derechos humanos y los valores propios de una cultura de paz y de valores democráticos; utilizando un lenguaje que evite el androcentrismo y los estereotipos.
- HB01 - Diferenciar nuevos métodos y teorías de la bioingeniería para potenciar la versatilidad, la capacidad de adaptación a nuevas situaciones y la resolución de problemas mediante el uso del razonamiento crítico.
- HB02 - Validar los resultados, cálculos, estudios, informes, planes de labores y otros trabajos análogos obtenidos mediante la experimentación científica.
- HB03 - Evaluar el impacto social y medioambiental de las soluciones técnicas a través del análisis y la aplicación de los principios y métodos de calidad.
- HB04 - Aplicar la terminología propia de la bioingeniería, en un ambiente multilingüe y multidisciplinar, con un nivel oral y escrito de inglés adecuado.
- HB06 - Relacionar problemas sociales con problemas sanitarios, mediante el uso equilibrado y compatible de la técnica, la tecnología, la economía y la sostenibilidad.
- HB07 - Utilizar todo el procesado de datos e información en el ámbito de la bioingeniería para una posterior valoración crítica de los resultados.
- HB08 - Resolver los problemas acontecidos en el ámbito de la Bioingeniería en el campo de la salud mediante la aplicación de conceptos multidisciplinares.
- HB09 - Examinar la influencia de los temas relacionados con la bioingeniería en las necesidades o características específicas de los géneros: aspectos biológicos y médicos.
- HB10 - Aplicar los conocimientos en el uso de métodos computacionales avanzados para mejorar la calidad del sistema sanitario.
- HB12 - Discriminar la información relevante de diferentes fuentes de información, libros y/o artículos científicos, relacionada con la bioingeniería.
Contenidos
1. Introducción al aprendizaje automático (Machine Learning)
2. Modelos lineales
3. Aprendizaje estadístico
4. Máquinas de vectores de soporte (SVM)
5. K-vecinos más cercanos (k-NN)
6. Árboles de decisión y bosques aleatorios (Random Forest)
7. Interpretabilidad de modelos
8. Redes neuronales
9. Arquitecturas y ecosistemas de Big Data (Hadoop, Spark, Kafka)
10. Escalabilidad y tolerancia a fallos en sistemas distribuidos
11. Procesos de extracción, transformación y carga (ETL)
12. Almacenamiento de datos en Big Data
13. Procesamiento masivo de datos (MapReduce y Apache Spark)
14. Procesamiento en memoria y RDD (Resilient Distributed Datasets)
15. Procesamiento de datos en tiempo real (Spark Streaming y Apache Flink)
16. Seguridad y gobernanza de datos (normativas GDPR y CCPA)
Metodología y actividades formativas
Modalidad totalmente presencial en el aula
La asignatura se dividirá en: 1) clases teóricas interactivas y 2) sesiones de laboratorio y ejercicios prácticos.
● Materiales de estudio: Acceso a contenidos preparados previamente (documentos, vídeos y lecturas recomendadas) a través de Moodle, para orientar el aprendizaje autónomo.
● Trabajo autónomo: Los estudiantes son responsables de su aprendizaje mediante el estudio de los materiales, la búsqueda de información adicional y la realización de actividades prácticas.
● Tutorías: Disponibles en modalidad virtual o presencial para resolver dudas.
Sistemas y criterios de evaluación
Modalidad totalmente presencial en el aula
1.ª convocatoria:
• Conocimientos teóricos (clases interactivas) (40 %)
• Laboratorios prácticos y ejercicios prácticos (60 %)
2.ª convocatoria: Solo se tendrá en cuenta la calificación del examen de la 2.ª convocatoria. Además, no habrá opción a obtener matrícula de honor.
● Se requiere una calificación mínima de 5,0 sobre 10 para aprobar.
● Si no se aprueba el examen parcial, el examen final computará el 70 % de la nota final.
Otras convocatorias
Calificación final (intentos 2.º a 6.º): 100 % examen final o de recuperación; se requiere un mínimo de 5,0 sobre 10 para aprobar.
EXAMEN DE RECUPERACIÓN
● Mismo formato que el «EXAMEN FINAL».
Bibliografía y recursos
● “An Introduction to Statistical Learning” – James, Witten, Hastie, Tibshirani,
Taylor, Springer, 2023.
● “The elements of statistical learning” – Hastie, Tibshirani, Friedman, Springer,
2017.
● "Big Data: Principles and Best Practices of Scalable Real-Time Data Systems"
– Nathan Marz, James Warren, Manning Publications, 2015.
● "Designing Data-Intensive Applications" – Martin Kleppmann, O'Reilly Media,
2017.
● "Fundamentals of Data Engineering" – Joe Reis, Matt Housley, O'Reilly Media,
2022.
● "Streaming Systems" – Tyler Akidau, Slava Chernyak, Reuven Lax, O'Reilly
Media, 2018.