Curso de LLMs con Hugging Face

Aprende a usar Transformers, Datasets y Tokenizers para adaptar modelos y resolver tareas de lenguaje natural con Python.

El curso de LLMs de Hugging Face enseña procesamiento del lenguaje natural mediante las librerías Transformers, Datasets, Tokenizers y Accelerate. Su recorrido combina conceptos sobre arquitecturas con código para usar, ajustar y compartir modelos disponibles en el Hugging Face Hub.

Aunque está disponible gratuitamente y cuenta con traducción al español, no es un curso desde cero. La propia introducción recomienda un dominio amplio de Python y haber estudiado deep learning antes de comenzar.

Del uso de modelos a su ajuste

Tramo Contenidos principales Resultado práctico
Capítulos 1 a 4 Transformers, pipelines y modelos preentrenados Usar un modelo y adaptarlo a datos propios
Capítulos 5 a 8 Datasets, tokenización y tareas de PLN Preparar datos y resolver problemas habituales
Capítulos 9 a 12 Habla, visión, demos y optimización Llevar Transformers a otros formatos y producción

El primer tramo permite reconocer las familias de modelos: codificadores, decodificadores y arquitecturas secuencia a secuencia. Esa distinción ayuda a elegir una solución según la tarea, por ejemplo clasificación, generación o traducción.

Herramientas que aparecen en el trabajo práctico

  • pipeline(): ejecuta tareas frecuentes con modelos preentrenados y reduce el código inicial.
  • Transformers: proporciona arquitecturas, configuraciones, modelos y utilidades de entrenamiento.
  • Datasets: organiza la carga, transformación y procesamiento de conjuntos de datos.
  • Tokenizers: convierte texto en las unidades que procesa el modelo.
  • Hugging Face Hub: permite localizar modelos y compartir resultados.

Los capítulos posteriores amplían el recorrido hacia ajuste fino, habla, visión y demostraciones interactivas. Conviene ejecutar los ejemplos, modificar parámetros y observar resultados; leer el código sin probarlo deja fuera una parte importante del aprendizaje.

Antes de empezar

Comprueba que puedes crear funciones, usar clases, instalar paquetes y trabajar con entornos de Python. También deberías entender entrenamiento, validación y sobreajuste a nivel introductorio. No necesitas experiencia previa con PyTorch o TensorFlow, aunque conocer alguno facilita la lectura del código.

Una preparación razonable consiste en:

  1. configurar un cuaderno o entorno virtual;
  2. repasar arrays, diccionarios y manejo de datos en Python;
  3. ejecutar un pipeline de clasificación;
  4. registrar el modelo, la entrada y la salida de cada prueba.

Cómo estudiar un capítulo técnico

Divide cada capítulo en concepto, ejemplo y modificación propia. Después del ejemplo oficial, cambia el texto de entrada o el modelo y explica por qué varió la salida. Guarda también los errores de memoria, dimensiones o tokenización: resolverlos forma parte del aprendizaje real.

Este curso resulta especialmente útil para desarrolladores y perfiles de datos que buscan trabajar con el ecosistema abierto de Hugging Face. No ofrece certificado y su duración depende del ritmo, del entorno de cómputo y de cuánto profundices en los ejercicios.

Abre el curso original de Hugging Face.

Abrir curso original