← Volver

Ver sin etiquetas

DINO aprende representaciones visuales generales directamente de las imágenes.

Varias imágenes junto a mapas de características producidos por DINO.
La representación puede reutilizarse para buscar, agrupar, localizar o comparar.

La señal está en los datos

La auto-supervisión crea objetivos de entrenamiento sin categorías anotadas por personas.

SupervisadoPredice etiquetas humanas y queda ligado a su taxonomía.
Auto-supervisadoExplota estructura, vistas y relaciones presentes en las imágenes.

El modelo fabrica su ejercicio

Transformaciones, partes ocultas o agrupaciones proporcionan una señal de aprendizaje.

Animación con ejemplos de aprendizaje contrastivo, predicción enmascarada, rotación y clustering.

La estudiante sigue una referencia

La red maestra es una versión suavizada de la estudiante y produce objetivos estables.

Animación del entrenamiento de DINO con una red estudiante y una red maestra.
¿Qué función cumple la red profesora en DINO?

Emergen regiones coherentes

Los mapas de atención pueden alinearse con objetos aunque no haya máscaras de entrenamiento.

Imagen de un animal y mapa de atención de DINO resaltando el objeto principal.
La atención muestra dónde se concentra el modelo; no es una máscara validada por sí sola.

Reconocer la misma imagen

Embeddings robustos permiten recuperar copias incluso después de varias transformaciones.

Comparación de recuperación de copias de imágenes con DINO y otros enfoques.
La similitud semántica puede resistir recortes, cambios de color o texto superpuesto.

De DINO a DINOv3

La familia escala datos y modelos mientras mejora la calidad de las características densas.

Animación que compara mapas de características de distintas generaciones de DINO.

La curación también aprende

DINOv2 usa embeddings para deduplicar y recuperar imágenes parecidas a un conjunto curado.

Pipeline de curación de datos de DINOv2 con embeddings, deduplicación y recuperación.
El modelo ayuda a construir un conjunto diverso sin etiquetar cada imagen.

Dos vistas de una imagen

La estudiante observa detalles y aprende a concordar con el contexto de la maestra.

  1. AumentarCrops locales y globales.
  2. EstudianteProcesa varias vistas.
  3. MaestraProcesa vistas globales.
  4. AlinearSe comparan salidas.
  5. ActualizarPromedio móvil.

Una base para muchas tareas

Las mismas características sirven para regiones, correspondencias, recuperación y clasificación.

Ejemplos visuales de segmentación, correspondencias y detección a partir de características DINO.
La tarea final añade una regla, un índice o una cabeza sobre el backbone.

Global y por regiones

DINO produce un resumen de imagen y una cuadrícula de embeddings por patch.

Visualización de características densas extraídas por DINO.
El token global compara imágenes; los patches conservan información espacial.

Cercanía según el modelo

La similitud coseno compara la dirección de dos embeddings normalizados.

Extrae un vector por imagen.

Normaliza antes de comparar.

Ordena vecinos y revisa errores.

Dos imágenes tienen embeddings cercanos. ¿Qué puedes concluir?

De features a un mapa visible

PCA colorea patches; t-SNE y UMAP proyectan grupos de embeddings en dos dimensiones.

Imágenes y visualización RGB de componentes principales de características DINO.
Los tres primeros componentes pueden mapearse a RGB para inspeccionar regiones.

Buscar correspondencias visuales

Un patch consulta qué regiones tienen una representación parecida.

Mapas de vecinos cercanos y correspondencias entre regiones de imágenes.
Los vecinos permiten comprobar si la representación conserva partes equivalentes.

Características densas estables

DINOv3 está diseñado para conservar detalle espacial al escalar el entrenamiento.

Animación de mapas de características DINOv3 en distintas escenas.

El mismo modelo, varias escalas

Las representaciones densas separan regiones sin recibir una taxonomía de píxeles.

Animación de características densas DINOv3 sobre objetos y paisajes.

Representar no es decidir

DINO encaja cuando faltan etiquetas y necesitas características reutilizables.

Úsalo para similitud, clustering o rasgos densos.

Compara con supervisado si hay muchas etiquetas fiables.

Mide coste y latencia en el hardware real.

Quieres detectar una anomalía industrial con DINO. ¿Qué falta además del embedding?

Aprender cómo se ve lo correcto

La detección de anomalías parte de ejemplos normales, no de una lista completa de fallos.

ReferenciasImágenes sin defecto y bien alineadas.
PatchesEmbeddings DINO normalizados.
CoreSetSubconjunto que resume la variación normal.

La distancia localiza la desviación

Cada patch nuevo se compara con su vecino normal más cercano.

  1. ImagenExtrae patches de test.
  2. kNNBusca vecinos normales.
  3. MapaLa distancia marca regiones.
  4. UmbralConvierte score en decisión.

Explora los embeddings

Extrae representaciones globales y densas con DINOv2.

  1. Guarda una copia en Drive.
  2. Compara dos imágenes.
  3. Interpreta patches y PCA.
Abrir en Colab