
Sec. 03 · Inteligencia Artificial
Detección en tiempo real con YOLO
You Only Look Once: un modelo que mira cada fotograma una sola vez y decide, al instante, qué hay en él — sin depender de subir cada imagen a la nube para saberlo.
Para la parte de inteligencia artificial del dron se ha usado YOLOv8, programando y entrenando el sistema directamente en la Raspberry Pi 5 que acompaña al dron a bordo.
¿Qué es YOLO?
Una sola pasada, una decisión inmediata
YOLO analiza la imagen completa de una vez, en lugar de examinarla región por región, lo que lo hace lo bastante rápido para procesar vídeo en directo. Es la razón por la que se puede ejecutar a bordo del propio dron, en la Raspberry Pi 5 con el acelerador Hailo-8L, sin depender de una conexión estable a Internet para saber si hay una persona en el encuadre.
Por qué en el borde, no en la nube
Subir vídeo en directo por un enlace 4G en zonas de montaña es lento y poco fiable. Procesando la detección directamente en la Raspberry Pi, el dron puede avisar de una posible detección aunque el enlace a la nube esté degradado o caído — coherente con la filosofía “edge-first” del resto del sistema. A esto se le llama edge computing: procesar los datos cerca de donde se generan, en lugar de enviarlos primero a un servidor remoto.
De dónde viene YOLO
YOLO (“You Only Look Once”) es una familia de modelos de detección de objetos en tiempo real, hoy mantenida por Ultralytics. Guardian Eye usa YOLOv8, una de sus versiones más recientes, elegida por su equilibrio entre precisión y velocidad de inferencia en hardware modesto como una Raspberry Pi.
Qué es una “caja delimitadora”
Cada detección se representa como una bounding box: un rectángulo definido por su centro, ancho y alto en píxeles, junto con un valor de confianza entre 0 y 1 que indica cuánto “cree” el modelo que ese rectángulo contiene realmente una persona.
YOLO y OpenCV cumplen papeles distintos y complementarios: YOLO se encarga de la inferencia y el análisis del fotograma —decidir qué hay y dónde—, mientras que OpenCV se usa para manipular la imagen en sí: leer el flujo de vídeo, recortar o redimensionar cada fotograma y dibujar la propia bounding box sobre él.
Estado real del proyecto
Un pipeline validado, un modelo en construcción
Prueba de concepto ya validada
El primer pipeline YOLOv8 completo se construyó y validó con Roboflow sobre un dataset pequeño de detección de fruta (~300 imágenes aumentadas), entrenado en 2 h 40 min en CPU, con inferencia comprobada sobre vídeo real de vuelo. Código en yolo-pipeline-test.
Dataset de personas en constante evolución y progreso
Se dispone de una base inicial de decenas de imágenes de personas extraídas de vuelos reales en el Club Alas de Galapagar, combinada en Roboflow con datasets SAR ya disponibles públicamente, seleccionando los más adecuados para el tipo de escenario del proyecto. El conjunto está en ampliación constante y se aumenta (data augmentation) para mejorar su calidad y variedad antes de cada nuevo entrenamiento.
Formato del mensaje de detección
Lo que YOLO reporta — y lo que no
YOLO no entrega coordenadas geográficas de la persona, sino su posición en píxeles dentro de la imagen. El sistema registra la posición del dron en el instante de la detección, no la localización exacta de la víctima —eso requeriría georreferenciación, una línea de trabajo futura. Tampoco hay seguimiento individual entre fotogramas: solo un margen anti-spam (por defecto, 5 s) para no repetir la misma alerta.
{
"confianza": 0.0-1.0,
"caja": { "centro_x": px, "centro_y": px,
"ancho": px, "alto": px },
"resolucion_frame": "WxH",
"posicion_dron": { "lat": ..., "lon": ... },
"foto_guardada": "deteccion_XXXX.jpg",
"timestamp": "AAAA-MM-DDTHH:MM:SSZ"
}Ver las detecciones en acción sobre vídeo real de vuelo.
Última actualización de estado: journal público del proyecto, agosto de 2026.