El seguimiento de visión por computadora sin marcadores de SketchAR es la solución de CV-tracking más potente para superficies.
La visión por computadora es un campo complejo basado en un proceso continuo de investigación y desarrollo. Aquí compartimos algunas razones de por qué y cómo hemos resuelto uno de los problemas más importantes de la visión por computadora: el miedo a la superficie plana.
SketchAR se ocupa de las superficies planas que se ven a través de la cámara de un smartphone al mirar una hoja de papel blanca o una pared. Para entender este entorno, tuvimos que inventar métodos y algoritmos que nos permitieran trabajar con todo tipo de superficies. Ya mencionamos en un artículo cómo funciona el Markerless Tracking. Ahora queremos mostrarte todos los casos de uso y las posibilidades de su potencial, y en qué campos podría aplicarse.

El método de Tracking Sin Marcadores de SketchAR es capaz de detectar superficies planas. Además, se mantiene estable incluso en condiciones extremas, como cuando la cámara no ve el entorno con claridad o cuando hace zoom y solo enfoca una superficie blanca.
SketchAR vs. ARKit/ARCore
Aquí comparamos el Tracking de SketchAR con las soluciones más populares de Apple y Google: ARKit y ARCore. Usamos las mismas condiciones en el mismo dispositivo: zoom extremo y movimiento del papel.
Blanco sobre blanco
Otra característica de SketchAR que vale la pena destacar es cómo podemos detectar superficies iguales o similares en color, como una hoja de papel blanca sobre una mesa blanca.
Aquí hay algunas características que queremos resaltar:
- Qué tan fácilmente una cámara puede reconocer una superficie tan compleja como una hoja de papel blanca sobre una mesa blanca.
- Qué tan estable es una imagen virtual cuando la cámara no ve el entorno con claridad, cuando hace zoom y solo enfoca una superficie blanca.
- Qué tanto puede salirse un papel del campo de visión de la cámara. Aquí puedes ver que la cámara solo detecta el 25 % del papel, pero la imagen virtual se mantiene muy estable en esas condiciones.
- Cómo la imagen virtual queda ‘pegada’ al mover una superficie con distintos ángulos con la mano.
Exteriores
Otro buen ejemplo de cómo el Markerless tracking funciona bien en diferentes condiciones son las pruebas de SketchAR en la calle, sobre una pared. Encontramos un trozo de pared que parecía un lienzo. Luego elegimos un boceto de la biblioteca de la app, lo colocamos sobre la pared y nos acercamos lo más posible, hasta unos 10 cm de la superficie. La imagen virtual se mantuvo lo suficientemente estable, incluso al mover el smartphone hacia la izquierda o la derecha.
A veces una pared blanca puede ser 100 % blanca, y la cámara no logra encontrar un punto de enfoque para trabajar correctamente. Ya tenemos una solución para esto y pronto lanzaremos una actualización del kernel.
Cómo funciona.
Ya mencionamos cómo usamos machine learning y redes neuronales para analizar toneladas de datos de nuestros usuarios y lograr que la app funcione correctamente. Estas son las cosas que analizamos:

SketchAR analiza todo lo que ocurre en la pantalla del smartphone.
- Superficie (tipos, estructura, etc.).
- Papel (formas, dimensiones).
- Objetos adicionales, para separarlos de la superficie y evitar que sean ‘ruido’ para la cámara.
- Manos, detectadas mediante redes neuronales convolucionales.
- Sombras, ya que siempre interrumpen el cv-tracking.
- Dibujos del usuario, para hacer coincidir esas inconsistencias con la imagen original.
- Reconocimiento de la estructura de la superficie (un papel) basado en la Matriz de Transformación (ML+NN). La cámara de un smartphone puede reconocer muchos tonos de un blanco similar (o de cualquier otro color plano).
- Los puntos de la cuadrícula están todos conectados en tiempo real. La reinicialización ocurre y los puntos de la cuadrícula regresan a su posición original. Cuando una mano sale del cuadro o se mueve a otro cuadrante, el píxel deseado de su lugar se vuelve a reconocer.
Este enfoque nos permite recopilar datos de usuarios reales de SketchAR (100 mil usuarios, ~80 % de ellos nos permite hacerlo). Nuestro kernel analiza estos datos como conexiones y relaciones entre los puntos de anclaje, y luego corrige la posición del objeto virtual con respecto a la superficie real sin retrasos, en tiempo real a 30 fps usando la GPU.
Nuestro mundo está hecho de superficies. Nuestro objetivo es enseñarle a las máquinas a entender mejor el entorno e interactuar con el mundo de forma más precisa.
Conoce más sobre el producto aquí.
Saludos,
Equipo de SketchAR



