El curso de LLMs de Hugging Face enseña procesamiento del lenguaje natural mediante las librerías Transformers, Datasets, Tokenizers y Accelerate. Su recorrido combina conceptos sobre arquitecturas con código para usar, ajustar y compartir modelos disponibles en el Hugging Face Hub.
Aunque está disponible gratuitamente y cuenta con traducción al español, no es un curso desde cero. La propia introducción recomienda un dominio amplio de Python y haber estudiado deep learning antes de comenzar.
Del uso de modelos a su ajuste
| Tramo | Contenidos principales | Resultado práctico |
|---|---|---|
| Capítulos 1 a 4 | Transformers, pipelines y modelos preentrenados | Usar un modelo y adaptarlo a datos propios |
| Capítulos 5 a 8 | Datasets, tokenización y tareas de PLN | Preparar datos y resolver problemas habituales |
| Capítulos 9 a 12 | Habla, visión, demos y optimización | Llevar Transformers a otros formatos y producción |
El primer tramo permite reconocer las familias de modelos: codificadores, decodificadores y arquitecturas secuencia a secuencia. Esa distinción ayuda a elegir una solución según la tarea, por ejemplo clasificación, generación o traducción.
Herramientas que aparecen en el trabajo práctico
- pipeline(): ejecuta tareas frecuentes con modelos preentrenados y reduce el código inicial.
- Transformers: proporciona arquitecturas, configuraciones, modelos y utilidades de entrenamiento.
- Datasets: organiza la carga, transformación y procesamiento de conjuntos de datos.
- Tokenizers: convierte texto en las unidades que procesa el modelo.
- Hugging Face Hub: permite localizar modelos y compartir resultados.
Los capítulos posteriores amplían el recorrido hacia ajuste fino, habla, visión y demostraciones interactivas. Conviene ejecutar los ejemplos, modificar parámetros y observar resultados; leer el código sin probarlo deja fuera una parte importante del aprendizaje.
Antes de empezar
Comprueba que puedes crear funciones, usar clases, instalar paquetes y trabajar con entornos de Python. También deberías entender entrenamiento, validación y sobreajuste a nivel introductorio. No necesitas experiencia previa con PyTorch o TensorFlow, aunque conocer alguno facilita la lectura del código.
Una preparación razonable consiste en:
- configurar un cuaderno o entorno virtual;
- repasar arrays, diccionarios y manejo de datos en Python;
- ejecutar un pipeline de clasificación;
- registrar el modelo, la entrada y la salida de cada prueba.
Cómo estudiar un capítulo técnico
Divide cada capítulo en concepto, ejemplo y modificación propia. Después del ejemplo oficial, cambia el texto de entrada o el modelo y explica por qué varió la salida. Guarda también los errores de memoria, dimensiones o tokenización: resolverlos forma parte del aprendizaje real.
Este curso resulta especialmente útil para desarrolladores y perfiles de datos que buscan trabajar con el ecosistema abierto de Hugging Face. No ofrece certificado y su duración depende del ritmo, del entorno de cómputo y de cuánto profundices en los ejercicios.