← Volver

Unir visión y lenguaje

Los modelos multimodales relacionan píxeles, palabras e instrucciones.

Representación de un sistema que analiza una imagen y lenguaje.
El tipo de salida distingue comparar, describir, localizar y razonar.

Una representación reutilizable

El preentrenamiento masivo produce características transferibles a tareas nuevas.

GeneralAprende patrones que sirven en varios problemas.
TransferibleSe adapta con prompts, ejemplos o ajuste.
EvaluableSu utilidad depende del dominio y la tarea.

Dos dominios, un espacio común

Imagen y texto se convierten en representaciones que el modelo puede relacionar.

Diagrama que proyecta imagen y texto en un espacio multimodal compartido.
La unión puede servir para medir similitud o alimentar un generador de lenguaje.

Nuevas categorías escritas

En zero-shot, las clases llegan como texto y no como una cabeza reentrenada.

Ejemplo de imágenes nuevas situadas cerca de conceptos conocidos en un espacio semántico.
Quieres separar fotos de interior y exterior sin entrenar un clasificador nuevo.

Comparar imagen y texto

CLIP acerca pares compatibles en un espacio de embeddings compartido.

Arquitectura de dos codificadores de CLIP para imagen y texto.
Dos codificadores producen vectores comparables mediante similitud coseno.

De una foto a una opción

La predicción es el texto cuyo vector queda más cerca de la imagen.

  1. ImagenEl encoder produce un vector.
  2. TextosCada opción produce otro vector.
  3. SimilitudSe comparan todos los pares.
  4. OrdenLa puntuación prioriza opciones.

Aprender por asociación

En cada lote, CLIP acerca las parejas correctas y separa las combinaciones incorrectas.

Matriz de similitud entre imágenes y textos donde la diagonal contiene las parejas correctas.
La diagonal representa los pares imagen-texto que sí corresponden.

CLIP no resuelve todo

Un embedding global no equivale a una explicación detallada de la escena.

Sí aportaSimilitud, recuperación y clasificación entre textos candidatos.
No aporta soloFrases, cajas, máscaras, OCR fiable o conteo preciso.

De la imagen a una frase

BLIP genera texto condicionado por características visuales.

Diagrama de BLIP para descripción de imágenes y preguntas visuales.
La atención cruzada permite al decodificador consultar la representación visual.

Texto que señala una región

Grounding DINO devuelve cajas para los objetos que coinciden con el prompt.

Prompt que nombra el concepto.

Cajas asociadas a fragmentos del texto.

Umbral que se valida en tu dominio.

Quieres localizar un defecto industrial nombrándolo en texto.

El lenguaje guía dónde mirar

Las características visuales y textuales se fusionan antes de predecir las cajas.

Arquitectura de Grounding DINO con codificador de texto, codificador de imagen, fusión y decoder.
La atención entre modalidades alinea palabras con regiones de la imagen.

Detección abierta y dirigida

La consulta define qué buscar y puede incluir atributos o referencias espaciales.

  1. Sin clases fijasEl vocabulario llega en el prompt.
  2. Sin anchorsLas queries predicen cajas directamente.
  3. FusiónTexto e imagen interactúan.
  4. AutoetiquetadoLas cajas pueden iniciar un dataset.

El prompt también puede fallar

Ambigüedad, objetos pequeños y escenas densas exigen validación específica.

Funciona bien como punto de partidaInspección, retail, seguridad, agricultura y anotación asistida.
Requiere atenciónJerga, solapes, conceptos vagos y detalles diminutos.

Cómo ve un modelo de lenguaje

Un adaptador convierte las características visuales en tokens que el LLM puede recibir.

VisiónEl encoder transforma píxeles en características.
AdaptadorAlinea dimensión y formato con el lenguaje.
LLMProcesa tokens visuales e instrucción.

Conversar y estructurar

Un VLM puede describir, leer documentos y devolver información con un formato pedido.

ComprenderOCR contextual, gráficos y diagramas.
RazonarComparaciones e instrucciones paso a paso.
EstructurarJSON o campos definidos por el usuario.

Cada modelo pide otro lenguaje

El prompt debe describir la salida que el modelo realmente puede producir.

CLIPPlantillas afirmativas y varias formulaciones.
GroundingConceptos breves separados y atributos visibles.
VLMInstrucción, criterio y formato de salida.

La salida elige el modelo

Usa la herramienta más sencilla que produzca la respuesta necesaria.

CLIP recupera o clasifica.

BLIP describe o responde algo sencillo.

Grounding DINO localiza; un VLM razona.

Necesitas una frase que describa una imagen.

Una respuesta fluida puede ser falsa

Evalúa alucinaciones, sesgos y errores con ejemplos representativos.

  1. DatosCasos reales y difíciles.
  2. MétricasSegún clasificación, cajas o texto.
  3. UmbralesAjustados al coste del error.
  4. RevisiónHumana cuando la decisión es crítica.

Cuatro formas de mirar

Compara CLIP, BLIP, Grounding DINO y Qwen con la misma imagen.

  1. Guarda una copia en Drive.
  2. Cambia imagen y prompts.
  3. Contrasta salidas y errores.
Abrir en Colab