scieee AI-readable full text Open interactive document viewer

Modelado del contexto geométrico para el reconocimiento de objetos

Ruiz-Sarmiento, José Raúl,Galindo-Andrades, Cipriano,González-Jiménez, Antonio Javier

Abstract

El reconocimiento de objetos es una tarea clave para dotar de cierta autonomía a un robot móvil.Los métodos de reconocimiento tradicionales han alcanzado un éxito aceptable empleando información sobre la apariencia y/o la geométrica de los objetos, aunque pueden presentar resultados ambiguos. Persiguiendo mitigar esta desventaja, en este trabajo se estudia cómo modelar información sobre el contexto geométrico de los objetos, la cual resulta útil para inclinar la balanza en reconocimientos ambiguos, de tal manera que se alcance un reconocimiento tan exitoso como sea posible. Para ello hemos recurrido a los Campos Aleatorios Condicionales como herramienta de modelado, y a Robot@Home como conjunto de datos para la evaluación. Con estas premisas se han alcanzado conclusiones interesantes para cualquier sistema reconocedor empleando información contextual.

Full text

Modelado del Contexto Geom´etrico para el Reconocimiento de Objetos Jose-Raul Ruiz-Sarmiento, Cipriano Galindo, Javier Gonzalez-Jimenez Departamento de Ingenier´ıa de Sistemas y Autom´atica, Instituto de Investigaci´on Biom´edica de M´alaga, Universidad de M´alaga, Campus de Teatinos, 29071, M´alaga {jotaraul,cgalindo,javiergonzalez}@uma.es Resumen El reconocimiento de objetos es una tarea clave para dotar de cierta autonom´ıa a un robot m´ovil. Los m´etodos de reconocimiento tradicionales han alcanzado un ´exito aceptable empleando informaci´on sobre la apariencia y/o la geometr´ıa de los objetos, aunque pueden presentar resultados ambiguos. Persiguiendo mitigar esta desventaja, en este trabajo se estudia c´omo modelar informaci´on sobre el contexto geom´etrico de los objetos, la cual resulta ´util para inclinar la balanza en reconocimientos ambiguos, de tal manera que se alcance un reconocimiento tan exitoso como sea posible. Para ello hemos recurrido a los Campos Aleatorios Condicionales como herramienta de modelado, y a Robot@Home como conjunto de datos para la evaluaci´on. Con estas premisas se han alcanzado conclusiones interesantes para cualquier sistema reconocedor empleando informaci´on contextual. Palabras clave: Reconocimiento de objetos, contexto geom´etrico, campos aleatorios condicionales, robots de servicio. 1 INTRODUCCI ´ ON Para que un robot m´ovil pueda prestar servicios con ´exito en su lugar de trabajo necesita alcanzar un cierto grado de comprensi´on sobre su entorno. El reconocimiento de objetos es una tarea clave para ello, ya que permite al robot interactuar con los elementos detectados en su alrededor. Este reconocimiento ha de ser fiable, ya que una clasificaci´on err´onea puede comprometer la integridad del robot, de su entorno, o incluso de seres humanos. Para visualizar esto, sup´ongase un robot encargado de proveer medicaci´on a una persona mayor, de regar las plantas, o de planchar la ropa. Los m´etodos de reconocimiento tradicionales que reconocen individualmente cada objeto en el entorno han alcanzado un ´exito notable [1, 2, 3]. No obstante, estos m´etodos pueden a menudo ofrecer resultados ambiguos que comprometen la operaci´on del robot, p.e. un objeto cil´ındrico de ? ? ? ? ? ? observación 1 observación 2 Figura 1: Ejemplo del problema del modelado contextual. En el caso de la mesa de noche (c´ırculo naranja), sus relaciones de contexto (l´ıneas azules y verdes) van a depender del rango de contexto empleado, y de la extensi´on de la informaci´on contextual a modelar. tama˜no medio podr´ıa ser reconocido como una papelera, un jarr´on, una botella, etc [4]. Una manera de eliminar estas ambig¨uedades es la utilizaci´on de informaci´on sobre el contexto geom´etrico de los objetos: si hay una flor encima, probablemente sea un jarr´on [5]. Esta fuente de informaci´on permite analizar las relaciones entre los objetos, y es de gran valor a la hora de reconocerlos. Los Campos Aleatorios Condicionales, del ingl´es Conditional Random Fields (CRFs) [6], son una herramienta com´unmente usada para modelar y explotar informaci´on contextual. Estos modelos se basan en una representaci´on en forma de grafo, donde los nodos son interpretados como objetos, y los arcos conectan nodos/objetos con una relaci´on de contexto. Para crear dichos arcos se suele establecer un rango de contexto, que fija la distancia m´axima a la que dos objetos pueden estar situados en el entorno para considerarse que existe una relaci´on entre ellos. Por ejemplo, las relaciones que se muestran como l´ıneas azules en la Fig. 1 se establecer´an dependiendo de este rango de contexto. En la literatura tambi´en pueden encontrarse trabajos que consideran distintas fuentes de informaci´on contextual a modelar: proveniente de una observaci´on del entorno (imagen de intensidad, RGB-D, etc.), donde esta informaci´on puede ser escasa o pobre, o de una reconstrucci´on del mismo, lo que proporciona una mayor extensi´on de la informaci´on contextual (por ejemplo, las relaciones que aporta la imagen de la derecha en la Fig. 1, representada como l´ıneas verdes). La elecci´on del rango de contexto, o de la extensi´on de la informaci´on contextual, suelen hacerse de manera ad-hoc sin tener en cuenta sus posibles efectos en el reconocimiento. Este trabajo persigue proveer indicaciones ´utiles y buenas pr´acticas sobre el modelado de informaci´on contextual, de tal manera que cualquier sistema reconocedor explotando esta fuente de informaci´on pueda alcanzar unos resultados tan exitosos como sea posible. Para ello se utilizan los CRFs como herramienta para el modelado y aprovechamiento del contexto, y se estudian principalmente los dos factores anteriormente citados, la elecci´on i) del rango de contexto, y ii) de la extensi´on de la informaci´on a modelar. En dicho estudio se analiza la influencia de estos factores tanto en el ´exito del reconocimiento, como en los tiempos de ejecuci´on necesarios para los procesos de entrenamiento e inferencia sobre los CRFs, de tal manera que se pueda seleccionar la configuraci´on que m´as se ajuste a las necesidades de cada aplicaci´on. Para llevar a cabo los experimentos realizados durante el estudio se ha empleado el conjunto de datos Robot@Home [7], dada su complejidad y adecuaci´on al problema: fue recogido por un robot m´ovil en entornos dom´esticos. 2 TRABAJOS RELACIONADOS Los m´etodos de reconocimiento tradicionales han tenido un ´exito notable en aplicaciones donde se especializan en detectar un cierto tipo de objeto (e.g. caras humanas [1]) o donde los objetos a reconocer aparecen aislados [2]. Ejemplos de estos m´etodos son los que emplean descriptores de la imagen como Scale-Invariant Feature Transform (SIFT) [8] o Speeded-Up Robust Features (SURF) [9], los cuales son explotados por clasificadores como las Supported Vector Machines (SVMs) [10] o las Bag-of-Words (BoW) [3]. No obstante, su rendimiento tiende a bajar en situaciones donde el n´umero de posibles categor´ıas a reconocer es elevado, o donde los objetos aparecen en escenas pobladas con m´ultiples objetos en diversas localizaciones y configuraciones, como es el caso de entornos humanos (oficinas, hogares, etc.) [4]. Uno de los principales motivos detr´as de esta ca´ıda de rendimiento es la aparici´on de resultados ambiguos. No obstante, este fen´omeno se puede paliar con la utilizaci´on de informaci´on sobre el contexto geom´etrico de los objetos [5]. Los Modelos Gr´aficos Probabil´ısticos, del ingl´es Probabilistic Graphical Models (PGMs) [6], son utilizados en multitud de trabajos para modelar y explotar eficientemente dicho contexto. Para el caso del reconocimiento de objetos, los Campos Aleatorios Condicionales (del ingl´es Conditional Random Fields, CRFs), un tipo particular de PGM, han resultad especialmente exitosos. Estos modelos fueron empleados, por ejemplo, por Xiong y Huber [11] para el reconocimiento de los componentes b´asicos de un edificio: pared, suelo, techo, etc. Estos autores relacionan cada objeto con los kobjetos m´as cercanos, sin importar la distancia a la que se encuentren, enfoque que puede dar lugar a relaciones poco relevantes o inexistentes. Por su parte, el CRF dise˜nado por Rogers y Christensen [12] incluye relaciones entre los objetos y las habitaciones donde se encuentran, pero no entre los propios objetos, desaprovechando una valiosa fuente de informaci´on. Otro trabajo relevante es el de Lin, Fidler y Urtasun [13], donde los objetos son representados por sus cajas delimitadoras, y se considera que est´an relacionados si estas cajas se encuentran a una distancia menor de 50 cent´ımetros. Los autores del presente estudio tambi´en presentaron trabajos previos donde se emple´o dicho rango de contexto (p.e. [14, 15]). Quiz´as el trabajo m´as relacionado con el nuestro es el de Anand et al. [16], donde se usa un Campo Aleatorio de Markov (variante discriminativa de los CRFs) para reconocer objetos en entornos de oficinas y dom´esticos. En ´el se realiza un estudio superficial de la influencia del rango de contexto y de la extensi´on de la informaci´on contextual. En este trabajo se realiza un an´alisis m´as profundo de ambos factores, y tambi´en se estudia su repercusi´on en los tiempos de ejecuci´on de los procesos de entrenamiento e inferencia de los CRFs. 3 LA HERRAMIENTA: CRFs APLICADOS AL RECONOCIMIENTO La tarea del reconocimiento de objetos en una escena consiste en asignar categor´ıas de un conjunto L(p.e. mesa, maceta, cortina, cuadro, vaso, etc.) a las observaciones de los nobjetos en la misma x= [x1,· · · , xn]. Si se considera y= [y1,· · · , yn] como el vector de variables aleatorias que asignan a cada objeto en xuna categor´ıa de L, el problema del reconocimiento desde un punto de vista probabil´ıstico se define como la b´usqueda de la asignaci´on a yque maximiza la distribuci´on de probabilidad condicionada p(y|x). Dada su complejidad, la definici´on exhaustiva de esta distribuci´on no es factible. Es en este punto donde los CRFs nos ofrecen la posibilidad de representarla de tal manera que su computo pueda ser m´as eficiente. cama mesa de noche reloj lámpara cuadro cuadro cuadro cuadro X1 X6 X2 X4 X3 X5 X7X8 X9 cesto y5 x5 y1y2 y4 y6 y7y9 y8 y3 I (y6,y9,x6,x9, θ ) U (y5,x5, θ ) x1 x3 x2 x6 x4 x7x8x9 Figura 2: Izquierda, reconstrucci´on de una habitaci´on con objetos segmentados (x1,· · · , x9). Derecha, representaci´on mediante un CRF en forma de grafo de dicha escena, donde aparece una variable aleatoria/nodo por cada objeto, y los objetos relacionados se conectan con un arco. Las formas naranjas representan el ´ambito de un factor local, las azules de un factor por pares, y las negras son el resultado de un proceso de inferencia sobre el CRF. Para ello, los CRFs emplean una representaci´on en forma de grafo G= (V,E), donde los nodos en Vse asocian con las variables aleatorias en y, y los arcos en Econectan nodos que guardan alg´un tipo de relaci´on. En el caso del reconocimiento de objetos, los nodos se conectan acorde al contexto geom´etrico de sus objetos asociados. As´ı si dos objetos est´an situados cerca en la escena, se entiende que el reconocimiento de uno tiene influencia directa (y mutua) en la categorizaci´on del otro, conect´andose sus nodos, mientras que si est´an alejados o en distintas habitaciones esta influencia no es tal. El c´omo decidir si dos objetos est´an cerca es motivo de discusi´on en la Sec. 4.1. Una vez construido el grafo Gque representa los objetos en el entorno del robot, la probabilidad p(y|x) se codifica sobre el mismo empleando el concepto de factor. Un factor puede interpretarse como una funci´on definida sobre parte del grafo que codifica un pedazo de dicha probabilidad, siendo t´ıpicamente de dos tipos: locales ypor pares. Los factores locales se refieren a un nodo del grafo, y establecen como de probable es para una variable aleatoria yiel pertenecer a una categor´ıa de Lde acuerdo a las caracter´ısticas visuales y/o geom´etricas del objeto xi. Por su parte, los factores por pares se definen sobre arcos, y determinan la compatibilidad de asignar dos categor´ıas de La dos variables relacionadas yiyyjteniendo en cuenta xiyxj. Estos factores suelen modelarse como clasificadores lineales de la siguiente forma: U(yi, xi,θ) = X l∈L δyi=lθlfxi(1) I(yi, yj, xi, xj,θ) = X l1∈L X l2∈L δyi=l1δyj=l2θfxixj(2) siendo U(·) un factor local definido sobre el nodo asociado a yi, y I(·) un factor por pares sobre el arco que conecta yiyyj. En estas ecuaciones δes la funci´on delta de Kronecker que toma el valor 1 si yi=l, y 0 si yi6=l,θes un vector de pesos o par´ametros aprendido durante la fase de entrenamiento del CRF, y fxiyfxixjson vectores de caracter´ısticas extra´ıdas de los objetos (color, tama˜no, forma, etc.) y de sus relaciones de contexto (distancia, diferencia en altura, ratio de tama˜no, etc.) respectivamente. Una vez definidas las piezas que componen un CRF, y deacuerdo con el teorema de HammersleyClifford, la funci´on de probabilidad P(y|x) puede ser finalmente factorizada sobre el grafo Gempleando modelos log-lineales como: P(y|x,θ) = 1 Z(x,θ)Y i∈V exp(U(yi, xi,θ)) Y (i,j)∈V exp(I(yi, yj, xi, xj,θ)) (3) La esencia de esta representaci´on es que, al elevar al exponente los factores, el resultado es siempre un valor mayor que 0, requisito b´asico para que el problema pueda modelarse mediante un CRF. Por su parte, Z(·) (tambi´en llamada funci´on de partici´on) normaliza los factores para que el resultado sea una distribuci´on de probabilidad, esto es Pξ(y)P(y|x,θ) = 1, siendo ξ(y) una asignaci´on posible a las variables en y. Para conseguir los resultados de reconocimiento hay que realizar un proceso de inferencia sobre el grafo G, el cual nos permite obtener la asignaci´on m´as probable ˆ ya las variables en y, esto es: ˆ y=arg max yP(y|x,θ) (4) Esta inferencia suele realizarse mediante m´etodos aproximados, ya que su c´omputo requiere del cal- culo de la funci´on de partici´on Z(·), que suele resultar impracticable en problemas reales. En el estudio realizado en este trabajo se ha empleado el m´etodo Loopy Belief Propagation (LBP), dado su buen rendimiento [17]. 4 MODELADO DEL CONTEXTO GEOM´ ETRICO Como se ha comentado, el modelado de la informaci´on contextual se basa en decidir qu´e objetos del entorno est´an relacionados entre s´ı, esto es, que nodos se conectan mediante un arco. Para tomar esta decisi´on se suele emplear un rango de contexto (distancia m´axima a la que se considera que dos objetos est´an relacionados), cuya elecci´on est´a estrechamente ligada al tipo de la informaci´on a modelar. Los trabajos m´as notorios en la literatura suelen usar observaciones de la escena proveyendo informaci´on de intensidad (imagen RGB) o de intensidad y profundidad (im´agenes RGB-D ). En el caso de im´agenes de intensidad, el rango de contexto puede establecerse en el plano de la imagen a nivel de pixel o super-pixel. As´ı, los pixeles o super-pixels que guardan relaci´on contextual son los que aparecen colindantes en la imagen. Con este enfoque no se respeta la geometr´ıa de la escena, por lo que, por ejemplo, una regi´on correspondiente con un objeto cercano a la c´amara podr´ıa conectarse con otro lejano. Tambi´en hay trabajos que realizan una reconstrucci´on tridimensional de la escena, bien buscando puntos de fuga, con im´agenes est´ereo, etc., la cual permite medir distancias geom´etricas entre los objetos para establecer su contexto. Por su parte, las im´agenes RGB-D ya proporcionan dicha informaci´on tridimensional, por lo que son aptas para realizar medidas geom´etricas. Este es el tipo de im´agenes utilizadas en este trabajo, discuti´endose a continuaci´on las distintas maneras de realizar mediciones en las mismas. 4.1 MEDICI ´ ON DE LA DISTANCIA ENTRE OBJETOS Una vez contamos con una imagen RGB-D de una escena, y considerando una representaci´on en forma de nube de puntos pc = [p1,· · · , pm] donde pi= [x, y, z, r, g, b] (informaci´on geom´etrica y de color), el primer paso para establecer las relaciones de contexto es segmentar los objetos o= [o1,· · · , on] que aparecen en la misma. Una vez segmentados, cada objeto se corresponder´a con una regi´on de la nube oi=pci,pci⊆pc. A continuaci´on se discuten las opciones m´as relevantes para calcular la distancias entre regiones. pc1 pc2 pc1 pc2 dist1 pc1pc2 dist2 pc1 pc2 dist3 a) b) c) Segmento de la env. convexa Muestra de la envolvente Muestra de la nube de puntos Punto del primer objeto Punto del segundo objeto Centroide Figura 3: Ejemplos de nubes de puntos pertenecientes a dos objetos en 2 dimensiones, y 3 maneras de calcular la distancia entre ellos. Entre los m´as populares, el primer enfoque para calcular la distancia entre pciypcjconsiste en calcular sus centroides pciypcjy obtener la distancia euclidea entre ambos, esto es: dist1(pci,pcj) = v u u t 3 X e=1 (pcie −pcje) (5) Aunque el c´alculo de esta distancia es r´apido, y el c´omputo de los centroides puede aprovecharse para describir los objetos, tiene el problema de que pares de objetos grandes y pr´oximos pueden presentar una distancia superior al rango de contexto y no ser conectados en el CRF (ver Fig. 3-a). Una segunda opci´on es el c´omputo de las envolventes convexas C(pci) y C(pcj) que encierran a todos los puntos de cada objeto. Tomando muestras de dicha envolvente se pueden obtener una serie de puntos ciycjsobre las que realizar mediciones de distancia eucl´ıdea, siendo la distancia entre dos objetos la menor de estas mediciones, es decir: dist2(pci,pcj) = min (pi∈ci,pj∈cj) v u u t 3 X e=1 (pie −pje) (6) El usar esta distancia tiene el inconveniente de que un objeto con partes c´oncavas podr´ıa generar mediciones de distancia irreales, dando lugar a relaciones de contexto err´oneas (ver Fig. 3-b). Por ´ultimo, un tercer enfoque consiste en usar la fuerza bruta para computar la distancia m´ınima entre cada par de puntos de dos objetos, lo cual soluciona los problemas presentados por las opciones anteriores. No obstante, este proceso es altamente ineficiente y har´ıa impracticable el reconocimiento. Una alternativa viable es la de construir una representaci´on de la nube de puntos que permita realizar b´usquedas de puntos cercanos de manera eficiente, como es el caso de los ´arboles kd [18]. Este es el enfoque usado en este trabajo, concretamente, se construye el ´arbol kd de pci,kdtreepci(complejidad O(nlog n), siendo n el n´umero de puntos), y se muestrea pcjpara obtener una serie de puntos mj. De manera eficiente (complejidad O(log n)) se busca el punto m´as cercano en el ´arbol a cada punto de mj, siendo la distancia entre los objetos el par m´as cercano (ver Fig. 3-c). Esto es: dist3(pci,pcj) = min (pi∈pci,pj∈mj)dist(kdtreepci, pj) (7) Como se ha comentado, una vez calculada la distancia entre dos objetos, se usa el rango de contexto fijado (p.e. un metro, dos, etc.) para decidir si existe o no una relaci´on de contexto geom´etrico entre ambos. La elecci´on del rango de contexto es clave para poder sacar el m´aximo partido a estas relaciones, y es estudiado en profundidad en la Sec. 5. Con un rango corto se establecer´ıan pocas relaciones y podr´ıa descartarse informaci´on contextual valiosa, pero los procesos de entrenamiento e inferencia sobre CRFs ser´ıan r´apido. Por otro lado, un rango grande considerar´ıa una mayor porci´on de dicha informaci´on, pero podr´ıa perjudicar a los tiempos de entrenamiento e inferencia y aumentar su complejidad. El rango de contexto se ve influenciado por un factor adicional: la extensi´on de la informaci´on contextual contenida en la imagen, tal y como se comenta en la siguiente secci´on. 4.2 EXTENSI ´ ON DE LA INFORMACI ´ ON CONTEXTUAL Tanto cuando se usan im´agenes de intensidad como RGB-D, para sacarle el m´aximo partido a la informaci´on contextual es necesario que en la observaci´on aparezca la mayor porci´on de la escena posible. De no ser as´ı, esta informaci´on puede resultar escasa e incompleta en algunos casos, siendo de poca utilidad. Por ejemplo, en la Fig. 4 se muestran a la izquierda dos observaciones con informaci´on contextual limitada, mientras que en las de la derecha la extensi´on de esta es mucho mayor. Una manera de extender la informaci´on contextual a modelar es considerar una porci´on de la Figura 4: A la izquierda, nubes de puntos de una cocina y un cuarto de ba˜no con informaci´on contextual limitada. A la derecha, nubes de las mismas habitaciones donde la informaci´on contextual m´as extensa. escena mayor que la proporcionada por una simple imagen. Para ello se hace necesario propagar en el tiempo y el espacio la informaci´on en cada observaci´on mediante alg´un algoritmo de registro o reconstrucci´on. A pesar de lo interesante de su uso desde el punto de vista del aprovechamiento del contexto, el reconstruir una escena puede acarrear una serie de problemas adicionales fuente de errores en el sistema reconocedor. Por ejemplo, un mal registro de dos im´agenes puede hacer que los objetos aparezcan dobles o deformes. Adem´as, en aplicaciones donde se requiera que el reconocimiento de objetos funcione a una cierta frecuencia, el algoritmo de reconstrucci´on ha de ser suficientemente r´apido para soportar dicha frecuencia. Aunque el an´alisis de distintos m´etodos de reconstrucci´on est´a fuera del alcance de este art´ıculo, si es relevante el efecto de contar con distintas extensiones de la informaci´on contextual en el reconocedor, factor que se analiza en la siguiente secci´on. 5 ESTUDIO Y RESULTADOS En este apartado se introducen las herramientas y equipos empleados (Sec. 5.1) en el an´alisis del rango de contexto (Sec. 5.2) y la extensi´on de la informaci´on contextual (Sec. 5.3), as´ı como los resultados que se desprenden del estudio realizado. 5.1 HERRAMIENTAS EMPLEADAS Para el modelado, entrenamiento e inferencia de los CRFs en este trabajo se ha empleado la librer´ıa Undirected Probabilistic Graphical Models in C++ Tabla 1: Influencia de la utilizaci´on de distintos rangos de contexto sobre el n´umero de relaciones contextuales establecidas, los tiempos necesarios para el entrenamiento y la inferencia de los CRFs usados, y el ´exito en el reconocimiento de estos. Rango # de relaciones Tpo. entrenamiento Tpo. inferencia ´ Exito 0m0 (0%) 2.02s0.01ms 64.92% 0.5m631 (14%) 17.48s0.15ms 70.54% 1m1,379 (31%) 29.10s0.36ms 71.17% 1.5m2,107 (48%) 35.76s0.69ms 72.39% 2m2,917 (66%) 37.14s1.04ms 73.51% 3m3,805 (86%) 32.50s1.81ms 70.29% 4m4,248 (96%) 27.40s2.37ms 69.26% 5m4,387 (99%) 19.57s2.84ms 68.18% 6m4,410 (100%) 18.09s3.23ms 67.86% (UPGMpp) [19], un software libre especialmente desarrollado para facilitar la utilizaci´on de estos modelos en el reconocimiento de objetos. Por otra parte, para el an´alisis de las distintas opciones de modelado contextual se ha contado con el conjunto de datos Robot@Home [7]. Este repositorio contiene m´as de 69,000 im´agenes RGB-D capturadas por medio de un robot m´ovil en entornos dom´esticos reales, donde aparecen 157 categor´ıas de objetos etiquetadas. De entre ellas, en este trabajo se han seleccionado para ser reconocidas las 19 m´as comunes, sumando un total de ∼600 instancias de objetos. Para evaluar el ´exito en el reconocimiento se ha empleado validaci´on cruzada. En cada paso de este m´etodo se emplean las observaciones provenientes de una habitaci´on elegida al azar para evaluar, y las 31 restantes para entrenar. Esto se repite 1,000 veces cambiando la habitaci´on con la que evaluar, y los resultados son promediados. Las pruebas se realizaron en un ordenador con un microprocesador Intel Core i7-3820 a 3.60GHz. y una memoria RAM de 4x4GB. DDR3 a 1,600MHz. 5.2 INFLUENCIA DEL RANGO DE CONTEXTO Con el fin de medir la influencia del rango de contexto en el rendimiento del sistema de reconocimiento, se han usado las reconstrucciones de las 32 habitaciones comentadas (la Fig. 4 muestra a la derecha dos de ellas). Estas reconstrucciones tienen la forma de nubes de puntos con informaci´on geom´etrica y de apariencia (intensidad). La Tab. 1 muestra los resultados del estudio llevado a cabo, donde la primera fila se corresponde con un CRF que no emplea informaci´on contextual, mientras que el resto reportan el rendimiento de CRFs que usan esta informaci´on con distintos rangos de contexto. Se puede apreciar como el ´exito en el reconocimiento siempre es mayor en las configuraciones que explotan relaciones sin importar el rango elegido. En cuanto al n´umero de relaciones consideradas por cada opci´on, empleando un rango de contexto de 0.5 metros se explotan el 14% de ellas (4,410 existentes), mientras que hay que irse hasta una distancia de 6 metros para que se incluyan todas. Desde los 0 hasta los 2 metros, el incremento del rango de contexto acarrea un aumento en el ´exito del reconocedor, alcanz´andose con el ´ultimo un ∼73.5% (un ∼8.5% m´as que sin emplear contexto). Esto se debe a que, conforme aumenta el rango, entran en consideraci´on relaciones que tienden a cumplirse aunque no siempre presenten distancias cortas. Por ejemplo, en una cocina pueden aparecer un grifo y una placa de inducci´on t´ıpicamente a una distancia superior a medio metro. No obstante, hay un punto a partir del cual el incremento de este rango tiene un efecto negativo en el ´exito, dada la alta variabilidad de las relaciones y la aparici´on de otras que rara vez se cumplen. En el trabajo de Anand et al. [16] este punto se sit´ua en 0.6 metros en entornos dom´esticos. Esta considerable diferencia se debe probablemente a la extensi´on de la informaci´on contextual usada, como veremos en el siguiente apartado. El incremento del rango de contexto tambi´en conlleva un mayor tiempo de ejecuci´on del algoritmo de inferencia, que va desde los 0.15ms. con medio metro, hasta los 3.23ms. con 6 metros, situ´andose en 1.04ms. para el rango con el que se alcanza el mayor ´exito. Esto pone de manifiesto que una elecci´on arbitrar´ıa del rango puede resultar en un rendimiento no ´optimo del reconocedor. Un hecho curioso a primera vista es la evoluci´on del tiempo de entrenamiento. Al ser un proceso iterativo (Stochastic Gradient Descent, m´as informaci´on en [17]), el a˜nadir m´as carga computa- Tabla 2: Influencia que tiene la utilizaci´on de distintos rangos de contexto sobre el n´umero de relaciones contextuales establecidas, los tiempos necesarios para el entrenamiento y la inferencia de CRFs, y el ´exito en el reconocimiento. Rango # relaciones ´ Exito 0.5m235 70.63% 1m446 70.21% 1.5m650 69.71% 2m757 69.69% 3m854 69.49% 4m872 69.44% 5m908 69.32% 6m918 69.07% cional por iteraci´on al considerar m´as relaciones contextuales hace m´as costosa la fase de entrenamiento. As´ı ocurre hasta los 2 metros, pero a partir de ah´ı el tiempo necesario para entrenar baja. Esto se debe a la aparici´on de relaciones espurias, que impiden al proceso converger a modelos m´as exactos, resultando en un tiempo de ejecuci´on menor. En cualquier caso, los tiempos de entrenamiento son comedidos para un proceso que solo ha de ejecutarse una vez. 5.3 REPERCUSI ´ ON DE LA EXTENSI ´ ON DE LA INFORMACI ´ ON CONTEXTUAL Para analizar como afectan distintas extensiones de la informaci´on contextual al ´exito del reconocimiento se han entrenado y evaluado CRFs con im´agenes RGB-D individuales de las 32 habitaciones (la Fig. 4 muestra a la izquierda dos nubes de puntos formadas a partir de estas im´agenes). Estos CRFs se pueden comprar con los de la secci´on anterior, donde la extensi´on de esta informaci´on era m´as amplia. Para que la comparativa fuera lo m´as justa posible, de nuevo se ha empleado un m´etodo de validaci´on cruzada, pero en esta ocasi´on una imagen de una habitaci´on es escogida para evaluar, mientras que 31 im´agenes del resto de habitaciones se usan para entrenar (estas selecciones se hacen todas al azar). El proceso se repite mil veces, y se promedian los resultados. La Tab. 2 muestra los resultados obtenidos. Como se puede ver, el mayor ´exito se alcanza para un rango de contexto de medio metro (∼70.5%), rango similar al ´optimo alcanzado en [16], lo que hace pensar que la extensi´on de la informaci´on usada por Anand et al. era limitada. A partir de esa distancia, el ´exito decrece paulatinamente hasta el ∼69% obtenido con un rango de 6 metros. Esto se debe a que al considerar mayores rangos manteniendo una extensi´on de la informaci´on contextual baja, aparecen relaciones en las im´agenes que no se repiten a lo largo del conjunto de datos de entrenamiento, dificultando el ajuste de los CRFs. As´ı, la mejor configuraci´on empleando im´agenes individuales alcanza un ´exito 3 puntos porcentuales menor que empleando una extensi´on m´as amplia (∼70.5% vs. ∼73.5%). En lo referente al n´umero de relaciones con las que se trabaja, este tambi´en es menor, tal y como muestra la segunda columna de la tabla. Por ejemplo, con un rango de 6 metros se incluyen 918, por las 4,410 de la secci´on anterior. Por otro lado, el tiempo de ejecuci´on del algoritmo de inferencia se mantiene estable y por debajo de los 0.3ms., mientras que el de entrenamiento va desde los 8s. con un rango de 0.5m. hasta los 17s. con 3m., distancia a partir de la cual se mantiene constante. 6 CONCLUSIONES En este trabajo se ha estudiado como influyen distintas opciones de modelado del contexto geom´etrico en el rendimiento de sistemas basados en Campos Aleatorios Condicionales (del ingl´es Conditional Random Fields, CRFs) para el reconocimiento de objetos por parte de un robot m´ovil. En concreto, se ha analizado como afecta la utilizaci´on de distintos rangos de contexto, esto es, distancias m´aximas a las que se considera que dos objetos est´an relacionados, y de distintas extensiones de la informaci´on contextual: informaci´on proveniente de una imagen individual de la escena, o de una reconstrucci´on de la misma. En casos donde la informaci´on contextual es extensa (p.e. empleando reconstrucciones de la escena), el an´alisis realizado con el conjunto de datos Robot@Home reporta el beneficio de emplear un rango de informaci´on contextual de 2 metros, consiguiendo un ´exito del ∼73.5%, un tiempo de inferencia de 1.04ms, y un tiempo de entrenamiento de 37.14s. Para rangos menores, aunque los tiempos de entrenamiento e inferencia decrecen, tambi´en lo hace el ´exito alcanzado. En cambio, para rangos mayores, el tiempo de inferencia aumenta a la vez que desciende el ´exito reportado. Este es un efecto poco deseable que pone de manifiesto la necesidad del estudio completado para fijar un rango ´optimo. Por otra parte, cuando la extensi´on de la informaci´on contextual no es extensa (p.e. trabajando con im´agenes individuales), en el caso del conjunto de datos empleado los mejores resultados se consigue con un rango de 0.5 metros. En lo referente al ´exito alcanzado, este es un 3% menor que empleando informaci´on contextual extensa, aunque con tiempos de entrenamiento e inferencia tambi´en m´as bajos. Esto muestra la estrecha relaci´on que existe entre el rango de contexto y la extensi´on de esta informaci´on, siendo necesario en cada aplicaci´on particular adaptar el primero conforme a la amplitud del segundo. En un futuro se plantea el estudio de como podr´ıa influir en el reconocimiento la utilizaci´on de rangos de contexto din´amicos, que se ajustaran autom´aticamente dependiendo de la informaci´on disponible sobre la escena. Agradecimientos Este trabajo se ha desarrollado en el marco de los proyectos TEP2012-530 y DPI2014-55826-R, financiados por la Junta de Andaluc´ıa y el Ministerio de Ciencia e Innovaci´on respectivamente, ambos contando con fondos del Fondo Europeo de Desarrollo Regional (FEDER). Referencias [1] P. Viola and M. Jones. Rapid object detection using a boosted cascade of simple features. In Proceedings of the 2001 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR 2001), volume 1, pages 511– 518, 2001. [2] Jianguo Zhang, M. Marszalek, S. Lazebnik, and C. Schmid. Local features and kernels for classification of texture and object categories: A comprehensive study. In 2006 Conference on Computer Vision and Pattern Recognition Workshop (CVPRW’06), pages 13–13, June 2006. [3] D. Nister and H. Stewenius. Scalable recognition with a vocabulary tree. In IEEE Computer Society Conference on Computer Vision and Pattern Recognition, volume 2, pages 2161–2168, 2006. [4] M. Oliveira, L. Seabra Lopes, G. H. Lim, S. H. Kasaei, A. D. Sappa, and A. M. Tom´e. Concurrent learning of visual codebooks and object categories in open-ended domains. In 2015 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), pages 2488– 2495, Sept 2015. [5] Carolina Galleguillos and Serge Belongie. Context based object categorization: A critical survey. Computer Vision and Image Understanding, 114(6):712–722, June 2010. [6] D. Koller and N. Friedman. Probabilistic Graphical Models: Principles and Techniques. MIT Press, 2009. [7] J. R. Ruiz-Sarmiento, C. Galindo, and J. Gonz´alez-Jim´enez. Robot@home, a robotic dataset for semantic mapping of home environments. The International Journal of Robotics Research, 36(2):131–141, 2017. [8] David G. Lowe. Distinctive image features from scale-invariant keypoints. International Journal of Computer Vision, 60(2):91–110, November 2004. [9] Jan Knopp, Mukta Prasad, Geert Willems, Radu Timofte, and Luc Van Gool. Hough transform and 3d surf for robust three dimensional classification. In Proceedings of the 11th European Conference on Computer Vision: Part VI, ECCV’10, pages 589–602, Berlin, Heidelberg, 2010. Springer-Verlag. [10] M. Pontil and A. Verri. Support vector machines for 3d object recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 20(6):637–646, Jun 1998. [11] Xuehan Xiong and Daniel Huber. Using context to create semantic 3d models of indoor environments. In In Proceedings of the British Machine Vision Conference (BMVC 2010), pages 45.1–11, 2010. [12] J. G. Rogers and H. I. Christensen. A conditional random field model for place and object classification. In Robotics and Automation (ICRA), 2012 IEEE International Conference on, pages 1766– 1772, May 2012. [13] Dahua Lin, Sanja Fidler, and Raquel Urtasun. Holistic scene understanding for 3d object detection with rgbd cameras. IEEE International Conference on Computer Vision, 0:1417–1424, 2013. [14] J. R. Ruiz-Sarmiento, C. Galindo, and J. Gonz´alez-Jim´enez. Building multiversal semantic maps for mobile robot operation. Knowledge-Based Systems, 119:257 – 272, 2017. [15] J. R. Ruiz-Sarmiento, M. G¨unther, C. Galindo, J. Gonz´alez-Jim´enez, and J. Hertzberg. Online context-based object recognition for mobile robots. In 17th International Conference on Autonomous Robot Systems and Competitions (ICARSC). IEEE, April 2017. [16] Abhishek Anand, Hema Swetha Koppula, Thorsten Joachims, and Ashutosh Saxena. Contextually guided semantic labeling and search for three-dimensional point clouds. In The International Journal of Robotics Research, 32(1):19–34, January 2013. [17] J. R. Ruiz-Sarmiento, C. Galindo, and J. Gonz´alez-Jim´enez. A survey on learning approaches for probabilistic graphical models. application to scene object recognition. International Journal of Approximate Reasoning, 83(C):434–451, April 2017. [18] Jerome H. Friedman, Jon Louis Bentley, and Raphael Ari Finkel. An algorithm for finding best matches in logarithmic expected time. ACM Trans. Math. Softw., 3(3):209–226, September 1977. [19] J.R. Ruiz-Sarmiento, C. Galindo, and J. Gonz´alez-Jim´enez. UPGMpp: a Software Library for Contextual Object Recognition. In 3rd. Workshop on Recognition and Action for Scene Understanding, 2015.