Datamecum
Material

Tema 02: Ecosistema Hugging Face

Modelos listos para explorar

Hugging Face reúne modelos, datos, demos y herramientas en un mismo ecosistema.

Logotipo de Hugging Face junto al nombre del servicio.
El Hub permite descubrir recursos; su calidad y condiciones se revisan uno a uno.

Cuatro piezas conectadas

Cada pieza resuelve una parte distinta del trabajo con modelos.

  1. ModelsPesos, configuración y model card.
  2. DatasetsDatos con carga y procesado comunes.
  3. TransformersAPI para carga, inferencia y ajuste.
  4. SpacesDemos web para probar modelos.

De la búsqueda a tu aplicación

Primero exploras, después pruebas y solo entonces integras.

1. BuscarFiltra por tarea, licencia y librería.
2. ProbarLee la ficha y usa una demo o notebook.
3. IntegrarFija versión, mide y documenta.

Empieza por la tarea

El filtro reduce candidatos; la documentación decide cuáles merece la pena probar.

Tarea y tipo de salida que necesitas.

Dominio de las imágenes de uso real.

Entorno de hardware, latencia y memoria.

Buscas un clasificador para imágenes médicas. ¿Qué debes hacer primero?

La ficha cuenta la historia

Una model card útil explica origen, uso, resultados y límites.

UsoTarea, entradas, código y casos previstos.
EvidenciaDatos, métricas y condiciones de evaluación.
RiesgosSesgos, fallos conocidos y licencia.

Descargar no significa poder usar

Código, pesos, datos y aplicación final pueden tener condiciones distintas.

PermisosUso comercial, modificación y redistribución.
ObligacionesAtribución, avisos, publicación o uso responsable.
RestriccionesÁmbitos excluidos, investigación o cláusulas específicas.

Revisa el artefacto completo

La etiqueta del repositorio es el inicio de la revisión, no su conclusión.

Identifica la versión y todos sus archivos.

Comprueba términos de código, pesos y datos.

Registra la decisión y las obligaciones.

Un repositorio tiene código permisivo, pero los pesos incluyen otra licencia. ¿Qué debes revisar?

Del Hub a la memoria

La primera ejecución descarga archivos; las siguientes pueden reutilizar la caché.

  1. IdentificadorRepositorio y revisión.
  2. DescargaConfiguración y pesos.
  3. MemoriaCPU, GPU y precisión.
  4. InferenciaEntrada, modelo y salida.

Cada archivo cumple una función

La configuración describe la arquitectura; los pesos contienen lo aprendido.

config.jsonArquitectura, tamaños y etiquetas.
model.safetensorsParámetros, a veces repartidos en fragmentos.
PreprocesadorResolución, normalización o tokenización.

Una API, muchas arquitecturas

from_pretrained reconstruye el procesador y el modelo desde su repositorio.

from transformers import AutoImageProcessor, AutoModelForImageClassification

model_id = "google/vit-base-patch16-224"
processor = AutoImageProcessor.from_pretrained(model_id)
model = AutoModelForImageClassification.from_pretrained(model_id)

Una prueba en pocas líneas

Un pipeline reúne preprocesado, inferencia y posprocesado para una tarea común.

from transformers import pipeline

detector = pipeline(
    "object-detection",
    model="PekingU/rtdetr_r50vd"
)
results = detector("imagen.jpg")
¿Qué simplifica un pipeline de Transformers?

Busca y prueba un modelo

Compara la documentación con lo que observas al ejecutar el cuaderno.

  1. Guarda una copia en Drive.
  2. Ejecuta el modelo propuesto.
  3. Elige otro y justifica la decisión.
Abrir en Colab