El camino hacia una precisión superior al 99%: superando los desafíos en la detección de teléfonos móviles
Usar el teléfono móvil mientras se conduce multiplica casi por cuatro la probabilidad de sufrir un accidente. Hoy en día, detectar el uso del móvil no es solo una función deseable, sino esencial. Las flotas buscan activamente soluciones para frenar este comportamiento de riesgo, y las alertas en tiempo real de RideView son la respuesta. Nuestro equipo de IA en LightMetrics ha descifrado el código con un algoritmo de distracción que cuenta con una precisión superior al 99%. ¿Alertas falsas? Son extremadamente raras. Hemos superado desafíos como la iluminación compleja y las diversas posiciones de las manos para garantizar una precisión casi perfecta sin concesiones. Así es como hacemos las carreteras más seguras, alerta a alerta.

Imagine que circula por una autopista. El sol brilla con fuerza y el horizonte lejano se ve como un destello. El potente coche que conduce avanza con fluidez por la carretera. De repente, suena su teléfono móvil: es la oficina. Tiene la opción de apartarse a un lado y atender la llamada o, por el contrario, seguir conduciendo y contestar. Muchas personas eligen esta última opción para ahorrar unos minutos. Sin embargo, esta decisión aumenta drásticamente el riesgo de accidente, casi cuadruplicándolo. Al usar el móvil mientras se conduce, la atención en la carretera disminuye y el tiempo de reacción necesario ante imprevistos aumenta. Hablar por el móvil al volante es uno de los principales factores de mortalidad en carretera, tal y como indican diversos informes de la NHTSA.
La detección del uso del teléfono móvil mediante la plataforma RideView se ha convertido en una función clave para la mayoría de nuestros socios. Hace un año, muchos consideraban que era una función secundaria, pero ahora son conscientes de que llamar y enviar mensajes mientras se conduce es peligroso y que carecen de visibilidad sobre ello. Las flotas buscan activamente reducir el riesgo derivado del uso del móvil mediante alertas en tiempo real cuando los conductores lo utilizan al volante. La detección de teléfonos móviles en la plataforma RideView logra precisamente eso. Envía alertas en tiempo real al conductor para que sea consciente de su comportamiento de riesgo, y la reincidencia se comunica a los propietarios y gestores de flotas, lo que les permite iniciar sesiones de formación con el conductor para corregir esta conducta.
El equipo de IA de LightMetrics ha logrado elevar el estándar en el desarrollo del algoritmo de distracción por uso de móvil, alcanzando una precisión superior al 99%. Nos hemos asegurado de que las alertas falsas sean muy, muy poco frecuentes, lo que genera una gran confianza en todas las partes interesadas: conductores y gestores de flotas. El camino para lograr una precisión superior al 99% ha sido un reto, especialmente al mantener una tasa de falsos positivos excepcionalmente baja y, al mismo tiempo, lograr una tasa de verdaderos positivos excepcional. Algunos de los desafíos a los que se enfrentó el equipo al desarrollar una solución que funcione a gran escala fueron
- Manos que parecen estar sosteniendo un teléfono
- La iluminación compleja dentro del vehículo provoca falsos positivos
- Datos del mundo real a gran escala para los casos extremos
A continuación, un breve resumen de cómo logramos una precisión casi perfecta sin sacrificar la recuperación:
Formas de las manos que se parecen mucho a las de una llamada
Observe el siguiente conjunto de fotos: a primera vista parece que la persona está hablando por teléfono, pero en realidad solo mantiene las manos en posiciones muy similares a las de una llamada, sin sostener ningún teléfono.

Los casos reales de llamadas con un teléfono en la mano se muestran a continuación

Como se puede observar, el objeto en la mano suele ser negro y, a veces, apenas es visible al confundirse con el fondo. Por defecto, el modelo de red neuronal comienza a centrarse en las posiciones de la mano o los dedos como característica dominante y, en muchos casos, empieza a emitir alertas de teléfono móvil incluso cuando no hay ningún objeto en la mano. Enseñar a la red neuronal a enfocarse en el objeto que se sostiene se convirtió en un objetivo principal al diseñar nuestros experimentos de entrenamiento.
Finalmente, una variante innovadora de las populares técnicas de pérdida contrastiva ayudó a que la red neuronal diera menos peso a las características de la mano y más peso al teléfono móvil que se sostiene.
Diferentes condiciones de iluminación que provocan falsos positivos
El modelo de red neuronal se habría entrenado con un conjunto de datos específico, pero en el campo puede encontrarse con un tipo de datos completamente diferente debido a reflejos o distintas fuentes de luz. Esto puede hacer que el modelo genere predicciones erróneas. A continuación, se pueden ver algunos ejemplos de esto.
.webp)
Esto se solucionó cuantificando en qué medida los datos están fuera de la distribución y, por lo tanto, son propensos a generar errores. Aprovechando la investigación sobre técnicas bayesianas y otros métodos de cuantificación de la incertidumbre, el equipo pudo señalar con precisión los casos en los que era probable que la red neuronal fallara, sin afectar a los casos normales.
Obtención de datos suficientes que cubran todo tipo de casos
Cuando la solución es utilizada por cientos de miles de usuarios, la variación en el montaje, la apariencia, etc., es enorme. Es importante que el modelo se generalice a todas esas variaciones y funcione de manera óptima. Cuando el equipo de LM comenzó a trabajar en este proyecto, confiamos en un conjunto de datos externo para la tarea, pero quedó claro que el cambio de dominio en esos datos frente a los capturados por nuestras cámaras era significativo. Probar diferentes técnicas de adaptación de dominio nos ayudó a mejorar el rendimiento de los modelos, pero la mejora real llegó finalmente cuando dejamos de usar el conjunto de datos externo y basamos el entrenamiento del modelo únicamente en datos de nuestras propias cámaras. Inicialmente, pensamos que esto afectaría a la capacidad de generalización del modelo, pero hacer que este se centrara en grandes variaciones de los mismos datos de cámara ayudó a llevar los límites de precisión y exhaustividad más allá de lo esperado. Contar con este gran corpus de datos ayudó a potenciar todas las técnicas anteriores utilizadas en relación con la arquitectura, la función de pérdida y la estimación de la incertidumbre.
En conclusión, detectar objetos pequeños como teléfonos móviles no es una tarea fácil de lograr con una precisión excepcional. Para la IA de borde en hardware asequible, la inferencia eficiente es clave, lo que hace que esta tarea, ya de por sí difícil, sea aún más compleja. Entrenar redes neuronales de manera que se centren solo en lo absolutamente esencial es crucial para el éxito en aplicaciones con limitaciones computacionales.

