Datamecum
Material

Tema 05: Segmentación con SAM

Segmentar cualquier objeto

La familia SAM convierte una indicación visual o textual en máscaras precisas.

Colección de escenas con objetos segmentados mediante máscaras de colores.
SAM 1 trabaja con imagen; SAM 2 añade vídeo; SAM 3 incorpora conceptos abiertos.

Una decisión por píxel

La máscara delimita la forma del objeto, mientras una caja solo aproxima su posición.

Comparación visual entre imagen, segmentación semántica, por instancias y panóptica.
El mismo píxel puede recibir categoría e identidad según la tarea.

Tres preguntas diferentes

Categoría, identidad y cobertura completa definen el tipo de segmentación.

Semántica¿Qué clase ocupa cada píxel?
Instancias¿Qué objeto individual ocupa cada píxel?
Panóptica¿Qué clase e instancia cubren toda la escena?

Codificar una vez, preguntar muchas

SAM 1 separa el encoder de imagen del prompt y del decoder de máscaras.

Arquitectura de SAM 1 con encoder de imagen, encoder de prompt y decoder de máscara.
El embedding de imagen se reutiliza durante una interacción con varios prompts.

La memoria conecta fotogramas

SAM 2 extiende la interacción a vídeo mediante un banco de memoria temporal.

Arquitectura de SAM 2 con encoder de imagen, memoria y decoder de máscara.
La memoria conserva información del objeto para propagarlo en el vídeo.

Primero presencia, después posición

Un token estima si el concepto existe; detector y tracker localizan y mantienen sus instancias.

Arquitectura de SAM 3 con encoder de percepción, detector, token de presencia y tracker.
Separar reconocimiento y localización ayuda a reducir falsos positivos de vocabulario abierto.

Imagen, vídeo y conceptos

Cada generación amplía el tipo de entrada y la persistencia de la máscara.

Animación que compara el resultado de SAM 1, SAM 2 y SAM 3.

El modelo acelera sus etiquetas

El motor de datos alterna anotación humana, asistencia y generación automática.

  1. ManualPersonas dibujan las primeras máscaras.
  2. AsistidaSAM propone y una persona corrige.
  3. AutomáticaSe conservan propuestas de alta calidad.

Indicar sin reentrenar

Un prompt convierte la intención del usuario en una condición espacial o semántica.

PuntosIncluyen o excluyen zonas concretas.
CajaAcota el objeto con rapidez.
MáscaraRefina una propuesta anterior.

Un clic elige el objeto

El punto positivo señala una región que debe pertenecer a la máscara.

Positivo dentro del objeto.

Negativo en una zona que sobra.

Varios para resolver ambigüedad.

Quieres segmentar una manzana entre otras frutas. ¿Qué prompt sirve para empezar?

Corregir sin volver a entrenar

Los nuevos clics añaden información sobre qué incluir y qué excluir.

Observa dónde falla el contorno.

Añade el prompt en esa región.

Repite hasta alcanzar el criterio.

La máscara incluye parte del fondo. ¿Qué harías?

Texto y ejemplos cambian la búsqueda

SAM 3 puede segmentar todas las instancias que coinciden con un concepto.

TextoUna frase nominal como “paraguas rojo a rayas”.
EjemplarUn recorte muestra visualmente qué instancias buscar.

La máscara no nombra la especie

SAM delimita; otra señal debe reconocer, decidir o justificar.

Úsalo con objetos nuevos y anotación interactiva.

Combínalo con detector, clasificador o VLM.

Compara modelos ligeros en entornos fijos.

Necesitas saber qué especie aparece y segmentarla.

Segmenta y corrige

Prueba cómo cambian las máscaras con puntos positivos y negativos.

  1. Guarda una copia en Drive.
  2. Segmenta con un punto.
  3. Refina y compara máscaras.
Abrir en Colab