Pasar al contenido principal

Universitat Internacional de Catalunya

Big Data e Inteligencia Artificial

Big Data e Inteligencia Artificial
3
15815
1
Primer semestre
OB
Lengua de impartición principal: catalán

Otras lenguas de impartición: inglés, castellano,

Presentación

La asignatura de Big Data e Inteligencia Artificial está diseñada para proporcionar a los estudiantes una comprensión integral de dos pilares complementarios del desarrollo moderno basado en datos: el aprendizaje automático (*machine learning*) y la ingeniería de datos a gran escala.
En el componente de Inteligencia Artificial, los estudiantes adquirirán una sólida base teórica y práctica en modelado predictivo. Partiendo de los modelos lineales y la teoría del aprendizaje estadístico, el curso avanza a través de máquinas de vectores de soporte, el algoritmo de los k-vecinos más cercanos, árboles de decisión, bosques aleatorios y redes neuronales, incluyendo un módulo específico sobre la interpretabilidad de los modelos para garantizar que las predicciones puedan comprenderse, auditarse y generar confianza en implementaciones del mundo real.
En el componente de Big Data, los estudiantes explorarán las herramientas y procesos utilizados para gestionar y procesar grandes volúmenes de datos en entornos distribuidos. Mediante el estudio de tecnologías como Hadoop, Spark y Kafka, aprenderán a construir sistemas escalables y resilientes, capaces de manejar conjuntos de datos masivos con alta disponibilidad y tolerancia a fallos. El curso también abordará los procesos ETL (extracción, transformación y carga), el almacenamiento eficiente de datos y el procesamiento en tiempo real utilizando herramientas como Apache Flink y Spark Streaming. Finalmente, se profundizará en conceptos clave como la seguridad y la gobernanza de datos, con especial atención a marcos normativos como el RGPD (GDPR) y la CCPA, ofreciendo una visión integral de los desafíos y soluciones dentro del ecosistema de Big Data.

Objetivos

Construir una base teórica en modelado predictivo: Comprender el marco de aprendizaje estadístico, el equilibrio entre sesgo y varianza y los principios de selección de modelos que sustentan todos los algoritmos supervisados y no supervisados.
 Dominar los algoritmos fundamentales de aprendizaje automático (ML): Adquirir conocimientos prácticos sobre modelos lineales, SVM, KNN, árboles de decisión, bosques aleatorios y redes neuronales, incluyendo sus supuestos, fortalezas y limitaciones.
 Desarrollar habilidades de interpretabilidad: Aprender a explicar y auditar las predicciones de los modelos utilizando técnicas como la importancia de las características (*feature importance*) y los valores SHAP, para permitir el despliegue responsable de sistemas de ML.
 Comprender la arquitectura de Big Data: Conocer las tecnologías clave (Hadoop, Spark, Kafka) y cómo construir sistemas distribuidos escalables y tolerantes a fallos.
 Dominar técnicas de procesamiento de datos: Adquirir experiencia en procesos ETL, MapReduce, Apache Spark y procesamiento de datos en tiempo real con Spark Streaming y Apache Flink.
 Explorar soluciones de almacenamiento de Big Data: Estudiar arquitecturas de almacenamiento eficientes que permitan un acceso rápido a grandes volúmenes de datos.

 Implementar seguridad y gobernanza de datos: Comprender la privacidad de los datos y el cumplimiento de normativas como el GDPR y la CCPA.
 Aplicar conocimientos prácticos: Diseñar e implementar soluciones de Big Data para entornos reales que sean escalables, seguras y eficientes.

Competencias/Resultados de aprendizaje de la titulación

  • CN01 - Describir los aspectos avanzados de la bioingeniería relacionados con la salud humana basándose en libros específicos de la materia juntamente con publicaciones científicas en la frontera del conocimiento
  • CN04 - Comparar los distintos enfoques de la computación y análisis de datos en la gestión de señales biomédicas.
  • CN05 - Explicar los principios de la bioingeniería empleados en el diseño y la fabricación de nuevas terapias de medicina personalizada.
  • CN06 - Identificar los pasos y desarrollos necesarios para el correcto procesamiento de dispositivos médicos basándose en los datos médicos disponibles.
  • CP01 - Interpretar los resultados científicos (tanto teóricos como prácticos) para emitir juicios con una reflexión crítica teniendo en cuenta conceptos de índole social, científica o ética.
  • CP02 - Trabajar en un equipo multidisciplinar de manera proactiva, tomando consciencia del rol a desarrollar.
  • CP06 - Producir tecnologías y productos aplicando los principios únicos de la bioingeniería para cada uso sanitario determinado, respetando los derechos fundamentales de igualdad entre hombres y mujeres, y la promoción de los derechos humanos y los valores propios de una cultura de paz y de valores democráticos; utilizando un lenguaje que evite el androcentrismo y los estereotipos.
  • HB01 - Diferenciar nuevos métodos y teorías de la bioingeniería para potenciar la versatilidad, la capacidad de adaptación a nuevas situaciones y la resolución de problemas mediante el uso del razonamiento crítico.
  • HB02 - Validar los resultados, cálculos, estudios, informes, planes de labores y otros trabajos análogos obtenidos mediante la experimentación científica.
  • HB03 - Evaluar el impacto social y medioambiental de las soluciones técnicas a través del análisis y la aplicación de los principios y métodos de calidad.
  • HB04 - Aplicar la terminología propia de la bioingeniería, en un ambiente multilingüe y multidisciplinar, con un nivel oral y escrito de inglés adecuado.
  • HB06 - Relacionar problemas sociales con problemas sanitarios, mediante el uso equilibrado y compatible de la técnica, la tecnología, la economía y la sostenibilidad.
  • HB07 - Utilizar todo el procesado de datos e información en el ámbito de la bioingeniería para una posterior valoración crítica de los resultados.
  • HB08 - Resolver los problemas acontecidos en el ámbito de la Bioingeniería en el campo de la salud mediante la aplicación de conceptos multidisciplinares.
  • HB09 - Examinar la influencia de los temas relacionados con la bioingeniería en las necesidades o características específicas de los géneros: aspectos biológicos y médicos.
  • HB10 - Aplicar los conocimientos en el uso de métodos computacionales avanzados para mejorar la calidad del sistema sanitario.
  • HB12 - Discriminar la información relevante de diferentes fuentes de información, libros y/o artículos científicos, relacionada con la bioingeniería.

Contenidos

1. Introducción al aprendizaje automático (Machine Learning)
2. Modelos lineales
3. Aprendizaje estadístico
4. Máquinas de vectores de soporte (SVM)
5. K-vecinos más cercanos (k-NN)
6. Árboles de decisión y bosques aleatorios (Random Forest)
7. Interpretabilidad de modelos
8. Redes neuronales
9. Arquitecturas y ecosistemas de Big Data (Hadoop, Spark, Kafka)
10. Escalabilidad y tolerancia a fallos en sistemas distribuidos
11. Procesos de extracción, transformación y carga (ETL)
12. Almacenamiento de datos en Big Data
13. Procesamiento masivo de datos (MapReduce y Apache Spark)
14. Procesamiento en memoria y RDD (Resilient Distributed Datasets)
15. Procesamiento de datos en tiempo real (Spark Streaming y Apache Flink)
16. Seguridad y gobernanza de datos (normativas GDPR y CCPA)

Metodología y actividades formativas

Modalidad totalmente presencial en el aula



La asignatura se dividirá en: 1) clases teóricas interactivas y 2) sesiones de laboratorio y ejercicios prácticos.
● Materiales de estudio: Acceso a contenidos preparados previamente (documentos, vídeos y lecturas recomendadas) a través de Moodle, para orientar el aprendizaje autónomo.
● Trabajo autónomo: Los estudiantes son responsables de su aprendizaje mediante el estudio de los materiales, la búsqueda de información adicional y la realización de actividades prácticas.
● Tutorías: Disponibles en modalidad virtual o presencial para resolver dudas.

Sistemas y criterios de evaluación

Modalidad totalmente presencial en el aula



1.ª convocatoria:

• Conocimientos teóricos (clases interactivas) (40 %)
• Laboratorios prácticos y ejercicios prácticos (60 %)

2.ª convocatoria: Solo se tendrá en cuenta la calificación del examen de la 2.ª convocatoria. Además, no habrá opción a obtener matrícula de honor.
● Se requiere una calificación mínima de 5,0 sobre 10 para aprobar.
● Si no se aprueba el examen parcial, el examen final computará el 70 % de la nota final.
Otras convocatorias
Calificación final (intentos 2.º a 6.º): 100 % examen final o de recuperación; se requiere un mínimo de 5,0 sobre 10 para aprobar.
EXAMEN DE RECUPERACIÓN
● Mismo formato que el «EXAMEN FINAL».

Bibliografía y recursos

● “An Introduction to Statistical Learning” – James, Witten, Hastie, Tibshirani,
Taylor, Springer, 2023.
● “The elements of statistical learning” – Hastie, Tibshirani, Friedman, Springer,
2017.
● "Big Data: Principles and Best Practices of Scalable Real-Time Data Systems"
– Nathan Marz, James Warren, Manning Publications, 2015.
● "Designing Data-Intensive Applications" – Martin Kleppmann, O'Reilly Media,
2017.

● "Fundamentals of Data Engineering" – Joe Reis, Matt Housley, O'Reilly Media,
2022.
● "Streaming Systems" – Tyler Akidau, Slava Chernyak, Reuven Lax, O'Reilly
Media, 2018.