← Volver

De píxeles a significado

Una imagen empieza como números. La tarea decide qué información buscamos.

Comparación entre visión humana y visión computacional ante una misma escena.
El modelo conecta patrones visuales con una salida útil.

¿Qué salida necesitas?

La misma imagen admite tareas distintas.

Un coche: la animación compara distintas tareas de visión
Quieres contar coches y localizar cada uno.

Detectar es localizar

Cada detección combina una caja, una categoría y una puntuación.

Calle con coches y peatones, cada uno rodeado por una caja de detección.
Caja · categoría · puntuación de confianza

Tres familias de detectores

Dos etapas, una etapa y detectores con transformer organizan el problema de formas diferentes.

Árbol de familias de arquitecturas de detección, desde modelos CNN y transformers.
El árbol sirve como mapa. Nos centraremos en las ideas que separan las familias.

Cómo cambió el recorrido

Tres etapas cambiaron cómo se proponen, predicen y asignan las cajas.

  1. 2014–2016 · Dos etapasR-CNN propone regiones y después las clasifica.
  2. 2015→ · Una etapaYOLO predice cajas y clases en una sola pasada.
  3. 2020→ · TransformersDETR aprende queries y asignación uno a uno.

Patrones, capa a capa

Las convoluciones extraen rasgos locales que capas posteriores combinan.

Animación de una red convolucional que transforma una imagen en mapas de características.

Primero regiones, después clases

Una RPN propone regiones; ROI Pooling reutiliza features; otra cabeza clasifica y refina.

Esquema de detector de dos etapas con propuestas de regiones, mapas de características y clasificación.
Más candidatos permiten refinar mejor, pero aumentan cálculo y latencia.

Eliminar trabajo repetido

Cada cambio de diseño buscó compartir más cálculo entre las regiones de una imagen.

Comparativa histórica del tiempo de inferencia de R-CNN, Fast R-CNN y Faster R-CNN.
Comparación histórica: los tiempos solo se interpretan con su hardware y protocolo originales.

Una propuesta se convierte en candidato

R-CNN ilustra el recorrido de una región desde la imagen hasta la clase.

Diagrama de R-CNN: imagen, propuestas de región, CNN, vector de características y clasificadores.

Una pasada, muchas predicciones

YOLOv1 popularizó la idea de producir cajas y clases directamente desde la imagen.

Resumen visual de YOLOv1: cuadrícula, cajas, confianza, clases y detecciones finales.
¿Qué describe la idea de un detector de una etapa?

La cuadrícula de YOLOv1

En la formulación original, una celda responde por objetos cuyo centro cae en ella.

Diagrama de YOLOv1 con cuadrícula, cajas delimitadoras, confianza y mapa de clases.
Esquema histórico de YOLOv1, no una descripción de todas las versiones posteriores.

De la imagen a las cajas

YOLOv1 usa una cuadrícula y predice cajas, confianza y clases de forma conjunta.

Arquitectura original de YOLOv1 desde la imagen de entrada hasta las predicciones de cajas y clases.
Una sola CNN conecta la imagen completa con todas las predicciones.

La familia siguió cambiando

Cada versión cambió una parte del entrenamiento, la arquitectura o la experiencia de uso.

  1. 2016 · v1Predicción directa.
  2. 2018 · v3Varias escalas.
  3. 2020 · v4CSP y Mosaic.
  4. 2020 · v5Flujo PyTorch.
  5. 2022 · v7E-ELAN.
  6. 2023 · v8Anchor-free y multitarea.
  7. 2024 · v9PGI y GELAN.

Qué intenta simplificar DETR

Las CNN aportan localidad; los detectores clásicos añaden heurísticas para relacionar y depurar predicciones.

ContextoLas capas locales necesitan combinarse para relacionar zonas lejanas.
SesgoLa localidad es útil, pero condiciona qué patrones se aprenden con facilidad.
HeurísticasAnchors y NMS añaden reglas e hiperparámetros al pipeline.

Consultas para objetos

DETR predice un conjunto de candidatos a partir de características visuales y consultas aprendidas.

Diagrama resumido de DETR con imagen, características, transformer y consultas de objetos.
Una consulta puede acabar asociada a una caja y una clase.

Asignar antes de aprender

Durante el entrenamiento, DETR relaciona predicciones y objetos reales uno a uno.

Comparación visual entre supresión de no máximos y asignación bipartita de predicciones a objetos de referencia.
¿Para qué sirve la asignación bipartita en DETR durante el entrenamiento?

Del backbone a las cajas

RF-DETR combina features multiescala, atención deformable y queries que se refinan.

Diagrama de RF-DETR con combinación multiescala, atención deformable, queries y cajas de salida.
  1. Combina features de varias escalas.
  2. Alinea puntos relevantes con atención deformable.
  3. Consulta el encoder mediante object queries.
  4. Refina las predicciones en el decoder.
  5. Entrega cajas sin anchors ni NMS.

Elegir requiere condiciones

Calidad, latencia, licencia y mantenimiento solo se comparan con versión, datos y hardware explícitos.

Gráficas de una comparativa de precisión y latencia entre detectores.
Una gráfica tiene sentido solo con su protocolo de medida y versiones concretas.

¿Cuánto coinciden las cajas?

IoU = área compartida ÷ área total ocupada.

Referencia Predicción

IoU0.33

Solapamiento parcial.

Contar aciertos y fallos

Una predicción puede acertar, duplicar un objeto o dejar un objeto sin detectar.

TPCaja y clase que corresponden a un objeto real.
FPFalsa alarma o predicción duplicada.
FNObjeto real que quedó sin predicción.

Precisión y recall responden a preguntas distintas

La precisión mira las predicciones; el recall mira los objetos reales.

Curva de precisión y recall que muestra cómo cambian al variar un umbral de confianza.
Precisión = TP / (TP + FP). Recall = TP / (TP + FN).
Hay 3 TP, 1 FP y 2 FN. ¿Cuáles son precisión y recall?

Filtrar no cambia las cajas

El umbral de confianza decide qué predicciones se muestran; IoU evalúa su solapamiento.

El filtro cambia qué predicciones ves, no sus coordenadas.
Subes el umbral de confianza y mantienes fijas las predicciones candidatas.

Una curva resume umbrales

AP resume precisión y recall al recorrer puntuaciones. mAP agrega AP según un protocolo.

Curva de precisión recall cuya área representa average precision.
AP50 y AP promediada entre varios umbrales IoU responden a protocolos distintos.

El vocabulario depende de los datos

Un checkpoint aprende las clases de sus datos. Tu aplicación puede necesitar otras.

Mosaico de ejemplos de COCO con cajas y categorías de objetos.
Tu checkpoint solo conoce clases COCO y necesitas detectar un defecto industrial nuevo.

Mide donde vas a usarlo

Un benchmark no sustituye datos representativos, latencia medida y análisis de errores.

Datos que representen escenas, clases y condiciones reales.

Latencia medida en el sistema de destino.

Errores revisados: falsas alarmas, objetos omitidos y casos límite.

Un detector logra mejor AP en un benchmark publicado. ¿Basta para elegirlo?

Ahora, con tu propia imagen

Prueba RF-DETR en tu copia del cuaderno.

  1. Guarda una copia en Drive.
  2. Ejecuta el detector con una imagen.
  3. Cambia el umbral de confianza: 0,25 · 0,50 · 0,75.

Un detector cerrado reconoce sus clases; el siguiente bloque añadirá lenguaje y zero-shot.

Abrir en Colab