33 research outputs found

    Joint TV-L1 optical flow and occlusion estimation

    No full text
    This document describes an implementation of the energy functional minimization proposed by Ballester, Garrido, Lazcano and Caselles for joint optical flow and occlusion estimation. The method build up from the ideas behind the TV-L1 approach introduced by Zach, Pock and Bischof in 2007 but incorporating information that allows to detect occlusions. This information is based on the divergence of the flow and the proposed energy favors the location of occlusions on regions where this divergence is negative. The implemented variational method uses three consecutive frames. The energy functional is composed of regularization terms using the total variation, a data term using the L1 norm, and a term dealing with the occlusions. In the present implementation, we solve the stationary system of partial differential equations arising from the dual minimization problem associated with the TV operator by a variation of the box relaxation numerical scheme proposed by Garamendi, Gaspar, Malpica and Schiavi. This makes the overall algorithm faster than previous implementations based on a gradient descent method.The first author was partially supported by the Ag`encia de Gestió d’Ajuts Universitaris i de Recerca de la Generalitat de Catalunya within the project PDJ-2014-00038. The first and third authors acknowledge partial support by the MINECO/FEDER project with reference TIN2015- 70410-C2-1-R and by the MICINN project with reference MTM2012-30772

    Some problems in depth enhanced video processing

    Get PDF
    In this thesis we tackle two problems, namely, the data interpolation prob- lem in the context of depth computation both for images and for videos, and the problem of the estimation of the apparent movement of objects in image sequences. The rst problem deals with completion of depth data in a region of an image or video where data are missing due to occlusions, unreliable data, damage or lost of data during acquisition. In this thesis we tackle it in two ways. First, we propose a non-local gradient-based energy which is able to complete planes locally. We consider this model as an extension of the bilateral lter to the gradient domain. We have successfully evaluated our model to complete synthetic depth images and also incomplete depth maps provided by a Kinect sensor. The second approach to tackle the problem is an experimental study of the Biased Absolutely Minimizing Lipschitz Extension (biased AMLE in short) for anisotropic interpolation of depth data to big empty regions without informa- tion. The AMLE operator is a cone interpolator, but the biased AMLE is an exponential cone interpolator which makes it more addapted to depth maps of real scenes that usually present soft convex or concave surfaces. Moreover, the biased AMLE operator is able to expand depth data to huge regions. By con- sidering the image domain endowed with an anisotropic metric, the proposed method is able to take into account the underlying geometric information in order not to interpolate across the boundary of objects at di erent depths. We have proposed a numerical model to compute the solution of the biased AMLE which is based on the eikonal operators. Additionally, we have extended the proposed numerical model to video sequences. The second problem deals with the motion estimation of the objects in a video sequence. This problem is known as the optical ow computation. The Optical ow problem is one of the most challenging problems in computer vision. Traditional models to estimate it fail in presence of occlusions and non-uniform illumination. To tackle these problems we proposed a variational model to jointly estimate optical ow and occlusion. Moreover, the proposed model is able to deal with the usual drawback of variational methods in dealing with fast displacements of objects in the scene which are larger than the object it- self. The addition of a term that balance gradient and intensities increases the robustness to illumination changes of the proposed model. The inclusions of a supplementary matches given by exhaustive search in speci cs locations helps to follow large displacements.En esta tesis se abordan dos problemas: interpolación de datos en el contexto del cálculo de disparidades tanto para imágenes como para video, y el problema de la estimación del movimiento aparente de objetos en una secuencia de imágenes. El primer problema trata de la completación de datos de profundidad en una región de la imagen o video dónde los datos se han perdido debido a oclusiones, datos no confiables, datos dañados o pérdida de datos durante la adquisición. En esta tesis estos problemas se abordan de dos maneras. Primero, se propone una energía basada en gradientes no-locales, energía que puede (localmente) completar planos. Se considera este modelo como una extensión del filtro bilateral al dominio del gradiente. Se ha evaluado en forma exitosa el modelo para completar datos sintéticos y también mapas de profundidad incompletos de un sensor Kinect. El segundo enfoque, para abordar el problema, es un estudio experimental del biased AMLE (Biased Absolutely Minimizing Lipschitz Extension) para interpolación anisotrópica de datos de profundidad en grandes regiones sin información. El operador AMLE es un interpolador de conos, pero el operador biased AMLE es un interpolador de conos exponenciales lo que lo hace estar más adaptado a mapas de profundidad de escenas reales (las que comunmente presentan superficies convexas, concavas y suaves). Además, el operador biased AMLE puede expandir datos de profundidad a regiones grandes. Considerando al dominio de la imagen dotado de una métrica anisotrópica, el método propuesto puede tomar en cuenta información geométrica subyacente para no interpolar a través de los límites de los objetos a diferentes profundidades. Se ha propuesto un modelo numérico, basado en el operador eikonal, para calcular la solución del biased AMLE. Adicionalmente, se ha extendido el modelo numérico a sequencias de video. El cálculo del flujo óptico es uno de los problemas más desafiantes para la visión por computador. Los modelos tradicionales fallan al estimar el flujo óptico en presencia de oclusiones o iluminación no uniforme. Para abordar este problema se propone un modelo variacional para conjuntamente estimar flujo óptico y oclusiones. Además, el modelo propuesto puede tolerar, una limitación tradicional de los métodos variacionales, desplazamientos rápidos de objetos que son más grandes que el tamaño objeto en la escena. La adición de un término para el balance de gradientes e intensidades aumenta la robustez del modelo propuesto ante cambios de iluminación. La inclusión de correspondencias adicionales (obtenidas usando búsqueda exhaustiva en ubicaciones específicas) ayuda a estimar grandes desplazamientos.Programa de doctorat en Tecnologies de la Informació i les Comunicacion

    An Empirical Study of Exhaustive Matching for Improving Motion Field Estimation

    No full text
    Optical flow is defined as the motion field of pixels between two consecutive images. Traditionally, in order to estimate pixel motion field (or optical flow), an energy model is proposed. This energy model is composed of (i) a data term and (ii) a regularization term. The data term is an optical flow error estimation and the regularization term imposes spatial smoothness. Traditional variational models use a linearization in the data term. This linearized version of data term fails when the displacement of the object is larger than its own size. Recently, the precision of the optical flow method has been increased due to the use of additional information, obtained from correspondences computed between two images obtained by different methods such as SIFT, deep-matching, and exhaustive search. This work presents an empirical study in order to evaluate different strategies for locating exhaustive correspondences improving flow estimation. We considered a different location for matching random locations, uniform locations, and locations on maximum gradient magnitude. Additionally, we tested the combination of large and medium gradients with uniform locations. We evaluated our methodology in the MPI-Sintel database, which represents the state-of-the-art evaluation databases. Our results in MPI-Sintel show that our proposal outperforms classical methods such as Horn-Schunk, TV-L1, and LDOF, and our method performs similar to MDP-Flow

    Some problems in depth enhanced video processing

    No full text
    In this thesis we tackle two problems, namely, the data interpolation prob- lem in the context of depth computation both for images and for videos, and the problem of the estimation of the apparent movement of objects in image sequences. The rst problem deals with completion of depth data in a region of an image or video where data are missing due to occlusions, unreliable data, damage or lost of data during acquisition. In this thesis we tackle it in two ways. First, we propose a non-local gradient-based energy which is able to complete planes locally. We consider this model as an extension of the bilateral lter to the gradient domain. We have successfully evaluated our model to complete synthetic depth images and also incomplete depth maps provided by a Kinect sensor. The second approach to tackle the problem is an experimental study of the Biased Absolutely Minimizing Lipschitz Extension (biased AMLE in short) for anisotropic interpolation of depth data to big empty regions without informa- tion. The AMLE operator is a cone interpolator, but the biased AMLE is an exponential cone interpolator which makes it more addapted to depth maps of real scenes that usually present soft convex or concave surfaces. Moreover, the biased AMLE operator is able to expand depth data to huge regions. By con- sidering the image domain endowed with an anisotropic metric, the proposed method is able to take into account the underlying geometric information in order not to interpolate across the boundary of objects at di erent depths. We have proposed a numerical model to compute the solution of the biased AMLE which is based on the eikonal operators. Additionally, we have extended the proposed numerical model to video sequences. The second problem deals with the motion estimation of the objects in a video sequence. This problem is known as the optical ow computation. The Optical ow problem is one of the most challenging problems in computer vision. Traditional models to estimate it fail in presence of occlusions and non-uniform illumination. To tackle these problems we proposed a variational model to jointly estimate optical ow and occlusion. Moreover, the proposed model is able to deal with the usual drawback of variational methods in dealing with fast displacements of objects in the scene which are larger than the object it- self. The addition of a term that balance gradient and intensities increases the robustness to illumination changes of the proposed model. The inclusions of a supplementary matches given by exhaustive search in speci cs locations helps to follow large displacements.En esta tesis se abordan dos problemas: interpolación de datos en el contexto del cálculo de disparidades tanto para imágenes como para video, y el problema de la estimación del movimiento aparente de objetos en una secuencia de imágenes. El primer problema trata de la completación de datos de profundidad en una región de la imagen o video dónde los datos se han perdido debido a oclusiones, datos no confiables, datos dañados o pérdida de datos durante la adquisición. En esta tesis estos problemas se abordan de dos maneras. Primero, se propone una energía basada en gradientes no-locales, energía que puede (localmente) completar planos. Se considera este modelo como una extensión del filtro bilateral al dominio del gradiente. Se ha evaluado en forma exitosa el modelo para completar datos sintéticos y también mapas de profundidad incompletos de un sensor Kinect. El segundo enfoque, para abordar el problema, es un estudio experimental del biased AMLE (Biased Absolutely Minimizing Lipschitz Extension) para interpolación anisotrópica de datos de profundidad en grandes regiones sin información. El operador AMLE es un interpolador de conos, pero el operador biased AMLE es un interpolador de conos exponenciales lo que lo hace estar más adaptado a mapas de profundidad de escenas reales (las que comunmente presentan superficies convexas, concavas y suaves). Además, el operador biased AMLE puede expandir datos de profundidad a regiones grandes. Considerando al dominio de la imagen dotado de una métrica anisotrópica, el método propuesto puede tomar en cuenta información geométrica subyacente para no interpolar a través de los límites de los objetos a diferentes profundidades. Se ha propuesto un modelo numérico, basado en el operador eikonal, para calcular la solución del biased AMLE. Adicionalmente, se ha extendido el modelo numérico a sequencias de video. El cálculo del flujo óptico es uno de los problemas más desafiantes para la visión por computador. Los modelos tradicionales fallan al estimar el flujo óptico en presencia de oclusiones o iluminación no uniforme. Para abordar este problema se propone un modelo variacional para conjuntamente estimar flujo óptico y oclusiones. Además, el modelo propuesto puede tolerar, una limitación tradicional de los métodos variacionales, desplazamientos rápidos de objetos que son más grandes que el tamaño objeto en la escena. La adición de un término para el balance de gradientes e intensidades aumenta la robustez del modelo propuesto ante cambios de iluminación. La inclusión de correspondencias adicionales (obtenidas usando búsqueda exhaustiva en ubicaciones específicas) ayuda a estimar grandes desplazamientos.Programa de doctorat en Tecnologies de la Informació i les Comunicacion

    Seguimiento 3D de Rostros e Iris Mediante Moldes Antropométricos

    Get PDF
    En el seguimiento de rostros e iris existe una gran cantidad de trabajos publicados, basados en diferentes técnicas consideras invasivas como: montaje de dispositivos electrónicos (electrodos, cámaras). Aprovechando la mayor velocidad de procesamiento alcanzada por los computadores personales y la disminución de costos de los sistemas de adquisición de video, se han desarrollado diferentes métodos no invasivos para el seguimiento de iris y rostros. En el Departamento de Ingeniería Eléctrica de la Universidad de Chile, se desarrolló un método no invasivo de seguimiento de iris que consiste en tres etapas: detección gruesa de la posición del rostro, detección fina y estimación del tamaño del rostro, y detección de la posición y tamaño del iris. La detección gruesa usa la metodología de Maio y Maltoni. La detección fina se realiza con una integral de línea, utilizando un molde antropométrico del rostro inclinado en el eje coronal, transversal y sagital, sobre una imagen direccional de entrada, estimándose así la posición, inclinación y tamaño del rostro. Conociendo estos valores es posible definir zonas de búsqueda más probables del iris. En la que se busca la posición y tamaño del iris recorriéndola con unos moldes semicirculares. Para el desarrollo de los nuevos moldes antropométricos y validación de la metodología, se construyeron bancos de imágenes estáticas de 5 individuos con rotaciones en el eje transversal. Los individuos rotaron sus rostros desde -45º a 45º con un paso de 15º. Además se construyeron 4 secuencias de video para los mismos individuos, que rotan sus rostros en el eje transversal y coronal. Se construyeron 4 secuencias de video de individuos que rotan su rostro en el eje sagital. Con estos bancos de imágenes se construyeron modelos empíricos de la variación de las posiciones de las características antropométricas del rostro y la excentricidad del rostro, frente a las rotaciones, transversales y sagitales. Finalmente se construyeron 4 secuencias de video de individuos que rotan su rostro en los 3 ejes. La metodología desarrollada se evaluó en el banco de secuencias de video para las rotaciones en los diferentes ejes. Para la rotación transversal se obtuvo que en todas las secuencias el desempeño es mayor que 89% y en 2 alcanza el 100%. Para el caso de la detección del iris se observa que el porcentaje de detección correcta fue mayor que 75% y en 2 secuencias fue mayor que 90%. Para el seguimiento sagital se obtuvo que la detección de rostros en tres de las secuencias fue más de 89% sólo en una se tiene 78%, en una alcanza 99%. Para el caso de la detección del iris se observa que el porcentaje de detección correcta fue mayor que 89% en 3 de las secuencias y en 1 secuencia mayor que 86%. En la rotación 3D se obtuvo valores de la tasa de detección correcta del rostro en tres secuencias mayores que 93% y en sólo una es de 18%. La tasa de detección correcta del iris sólo en una secuencia presenta un valor de 83%, en otra se alcanza 89% y en dos de ellas se supera el 90% de detección correcta. La metodología desarrollada para el seguimiento de rostros selectiva en el eje transversal con un paso de 20º, en el sagital con paso de 20º y en el coronal con paso de 15º. Se midieron los tiempos de procesamiento para rotaciones coronal-transversal y 3D. Para estos ejes se obtuvo un tiempo promedio de 0,020 s, y 0,028 s respectivamente, pudiéndose procesar hasta 50 imágenes y 35 imágenes por segundos respectivamente. Estos tiempos se midieron en un computador Pentium 4 de 3,2 GHz. Estos resultados permiten aplicar la metodología en tiempo real

    Depth Completion with Anisotropic Metric, Convolutional Stages, and Infinity Laplacian

    No full text
    Depth map estimation is crucial for a wide range of applications. Unfortunately, it often presents missing or unreliable data. The objective of depth completion is to fill in the “holes” in a depth map by propagating the depth information using guidance from other sources of information, such as color. Nowadays, classical image processing methods have been outperformed by deep learning techniques. Nevertheless, these approaches require a significantly large number of images and enormous computing power for training. This fact limits their usability and makes them not the best solution in some resource-constrained environments. Therefore, this paper investigates three simple hybrid models for depth completion. We explore a hybrid pipeline that combines a very efficient and powerful interpolator (infinity Laplacian or AMLE) and a series of convolutional stages. The contributions of this article are (i) the use a Texture+Structuredecomposition as a pre-filter stage; (ii) an objective evaluation with three different approaches using KITTI and NYU_V2 data sets; (iii) the use of an anisotropic metric as a mechanism to improve interpolation; and iv) the inclusion of an ablation test. The main conclusions of this work are that using an anisotropic metric improves model performance, and the ablation test demonstrates that the model’s final stage is a critical component in the pipeline; its suppression leads to an approximate 4% increase in MSE. We also show that our model outperforms state-of-the-art alternatives with similar levels of complexity
    corecore