Saltar al contenido
Guardian EyeTFG · Telecomunicaciones
Fotograma real del vídeo de detección de personas del dron en el Club Alas de Galapagar, con el pipeline YOLO detectando a una persona sobre vídeo de vuelo

Sec. 03 · Inteligencia Artificial

Detección en tiempo real con YOLO

You Only Look Once: un modelo que mira cada fotograma una sola vez y decide, al instante, qué hay en él — sin depender de subir cada imagen a la nube para saberlo.

Para la parte de inteligencia artificial del dron se ha usado YOLOv8, programando y entrenando el sistema directamente en la Raspberry Pi 5 que acompaña al dron a bordo.

¿Qué es YOLO?

Una sola pasada, una decisión inmediata

YOLO analiza la imagen completa de una vez, en lugar de examinarla región por región, lo que lo hace lo bastante rápido para procesar vídeo en directo. Es la razón por la que se puede ejecutar a bordo del propio dron, en la Raspberry Pi 5 con el acelerador Hailo-8L, sin depender de una conexión estable a Internet para saber si hay una persona en el encuadre.

Por qué en el borde, no en la nube

Subir vídeo en directo por un enlace 4G en zonas de montaña es lento y poco fiable. Procesando la detección directamente en la Raspberry Pi, el dron puede avisar de una posible detección aunque el enlace a la nube esté degradado o caído — coherente con la filosofía “edge-first” del resto del sistema. A esto se le llama edge computing: procesar los datos cerca de donde se generan, en lugar de enviarlos primero a un servidor remoto.

De dónde viene YOLO

YOLO (“You Only Look Once”) es una familia de modelos de detección de objetos en tiempo real, hoy mantenida por Ultralytics. Guardian Eye usa YOLOv8, una de sus versiones más recientes, elegida por su equilibrio entre precisión y velocidad de inferencia en hardware modesto como una Raspberry Pi.

Qué es una “caja delimitadora”

Cada detección se representa como una bounding box: un rectángulo definido por su centro, ancho y alto en píxeles, junto con un valor de confianza entre 0 y 1 que indica cuánto “cree” el modelo que ese rectángulo contiene realmente una persona.

YOLO y OpenCV cumplen papeles distintos y complementarios: YOLO se encarga de la inferencia y el análisis del fotograma —decidir qué hay y dónde—, mientras que OpenCV se usa para manipular la imagen en sí: leer el flujo de vídeo, recortar o redimensionar cada fotograma y dibujar la propia bounding box sobre él.

Estado real del proyecto

Un pipeline validado, un modelo en construcción

RecogidaVídeo aéreo real en el club
EtiquetadoVía Roboflow
EntrenamientoYOLOv8 / Ultralytics
ValidaciónSobre vídeo grabado
DespliegueInferencia en el borde (Hailo-8L)

Prueba de concepto ya validada

El primer pipeline YOLOv8 completo se construyó y validó con Roboflow sobre un dataset pequeño de detección de fruta (~300 imágenes aumentadas), entrenado en 2 h 40 min en CPU, con inferencia comprobada sobre vídeo real de vuelo. Código en yolo-pipeline-test.

Dataset de personas en constante evolución y progreso

Se dispone de una base inicial de decenas de imágenes de personas extraídas de vuelos reales en el Club Alas de Galapagar, combinada en Roboflow con datasets SAR ya disponibles públicamente, seleccionando los más adecuados para el tipo de escenario del proyecto. El conjunto está en ampliación constante y se aumenta (data augmentation) para mejorar su calidad y variedad antes de cada nuevo entrenamiento.

Formato del mensaje de detección

Lo que YOLO reporta — y lo que no

YOLO no entrega coordenadas geográficas de la persona, sino su posición en píxeles dentro de la imagen. El sistema registra la posición del dron en el instante de la detección, no la localización exacta de la víctima —eso requeriría georreferenciación, una línea de trabajo futura. Tampoco hay seguimiento individual entre fotogramas: solo un margen anti-spam (por defecto, 5 s) para no repetir la misma alerta.

{
  "confianza": 0.0-1.0,
  "caja": { "centro_x": px, "centro_y": px,
            "ancho": px, "alto": px },
  "resolucion_frame": "WxH",
  "posicion_dron": { "lat": ..., "lon": ... },
  "foto_guardada": "deteccion_XXXX.jpg",
  "timestamp": "AAAA-MM-DDTHH:MM:SSZ"
}

Ver las detecciones en acción sobre vídeo real de vuelo.

Ir a Multimedia

Última actualización de estado: journal público del proyecto, agosto de 2026.