33 research outputs found
Joint TV-L1 optical flow and occlusion estimation
This document describes an implementation of the energy functional minimization proposed by Ballester, Garrido, Lazcano and Caselles for joint optical flow and occlusion estimation. The method build up from the ideas behind the TV-L1 approach introduced by Zach, Pock and Bischof in 2007 but incorporating information that allows to detect occlusions. This information is based on the divergence of the flow and the proposed energy favors the location of occlusions on regions where this divergence is negative. The implemented variational method uses three consecutive frames. The energy functional is composed of regularization terms using the total variation, a data term using the L1 norm, and a term dealing with the occlusions. In the present implementation, we solve the stationary system of partial differential equations arising from the dual minimization problem associated with the TV operator by a variation of the box relaxation numerical scheme proposed by Garamendi, Gaspar, Malpica and Schiavi. This makes the overall algorithm faster than previous implementations based on a gradient descent method.The first author was partially supported by the Ag`encia de Gestió d’Ajuts Universitaris i de Recerca de la Generalitat de Catalunya within the project PDJ-2014-00038. The first and third authors acknowledge partial support by the MINECO/FEDER project with reference TIN2015- 70410-C2-1-R and by the MICINN project with reference MTM2012-30772
Study of Specific Location of Exhaustive Matching in Order to Improve the Optical Flow Estimation
Some problems in depth enhanced video processing
In this thesis we tackle two problems, namely, the data interpolation prob-
lem in the context of depth computation both for images and for videos, and
the problem of the estimation of the apparent movement of objects in image
sequences. The rst problem deals with completion of depth data in a region
of an image or video where data are missing due to occlusions, unreliable data,
damage or lost of data during acquisition. In this thesis we tackle it in two ways.
First, we propose a non-local gradient-based energy which is able to complete
planes locally. We consider this model as an extension of the bilateral lter to
the gradient domain. We have successfully evaluated our model to complete
synthetic depth images and also incomplete depth maps provided by a Kinect
sensor.
The second approach to tackle the problem is an experimental study of the
Biased Absolutely Minimizing Lipschitz Extension (biased AMLE in short) for
anisotropic interpolation of depth data to big empty regions without informa-
tion. The AMLE operator is a cone interpolator, but the biased AMLE is an
exponential cone interpolator which makes it more addapted to depth maps of
real scenes that usually present soft convex or concave surfaces. Moreover, the
biased AMLE operator is able to expand depth data to huge regions. By con-
sidering the image domain endowed with an anisotropic metric, the proposed
method is able to take into account the underlying geometric information in
order not to interpolate across the boundary of objects at di erent depths. We
have proposed a numerical model to compute the solution of the biased AMLE
which is based on the eikonal operators. Additionally, we have extended the
proposed numerical model to video sequences.
The second problem deals with the motion estimation of the objects in a
video sequence. This problem is known as the optical
ow computation. The
Optical
ow problem is one of the most challenging problems in computer vision.
Traditional models to estimate it fail in presence of occlusions and non-uniform
illumination. To tackle these problems we proposed a variational model to
jointly estimate optical
ow and occlusion. Moreover, the proposed model is
able to deal with the usual drawback of variational methods in dealing with
fast displacements of objects in the scene which are larger than the object it-
self. The addition of a term that balance gradient and intensities increases the
robustness to illumination changes of the proposed model. The inclusions of a
supplementary matches given by exhaustive search in speci cs locations helps
to follow large displacements.En esta tesis se abordan dos problemas: interpolación de datos en el contexto
del cálculo de disparidades tanto para imágenes como para video, y el
problema de la estimación del movimiento aparente de objetos en una secuencia
de imágenes. El primer problema trata de la completación de datos de profundidad
en una región de la imagen o video dónde los datos se han perdido debido
a oclusiones, datos no confiables, datos dañados o pérdida de datos durante la
adquisición. En esta tesis estos problemas se abordan de dos maneras. Primero,
se propone una energía basada en gradientes no-locales, energía que puede (localmente)
completar planos. Se considera este modelo como una extensión del
filtro bilateral al dominio del gradiente. Se ha evaluado en forma exitosa el
modelo para completar datos sintéticos y también mapas de profundidad incompletos
de un sensor Kinect.
El segundo enfoque, para abordar el problema, es un estudio experimental
del biased AMLE (Biased Absolutely Minimizing Lipschitz Extension) para
interpolación anisotrópica de datos de profundidad en grandes regiones sin información. El operador AMLE es un interpolador de conos, pero el operador
biased AMLE es un interpolador de conos exponenciales lo que lo hace estar
más adaptado a mapas de profundidad de escenas reales (las que comunmente
presentan superficies convexas, concavas y suaves). Además, el operador biased
AMLE puede expandir datos de profundidad a regiones grandes. Considerando
al dominio de la imagen dotado de una métrica anisotrópica, el método propuesto
puede tomar en cuenta información geométrica subyacente para no interpolar
a través de los límites de los objetos a diferentes profundidades. Se ha
propuesto un modelo numérico, basado en el operador eikonal, para calcular la
solución del biased AMLE. Adicionalmente, se ha extendido el modelo numérico
a sequencias de video.
El cálculo del
flujo óptico es uno de los problemas más desafiantes para la
visión por computador. Los modelos tradicionales fallan al estimar el
flujo óptico
en presencia de oclusiones o iluminación no uniforme. Para abordar este problema
se propone un modelo variacional para conjuntamente estimar
flujo óptico
y oclusiones. Además, el modelo propuesto puede tolerar, una limitación tradicional
de los métodos variacionales, desplazamientos rápidos de objetos que son
más grandes que el tamaño objeto en la escena. La adición de un término para
el balance de gradientes e intensidades aumenta la robustez del modelo propuesto
ante cambios de iluminación. La inclusión de correspondencias adicionales
(obtenidas usando búsqueda exhaustiva en ubicaciones específicas) ayuda a estimar
grandes desplazamientos.Programa de doctorat en Tecnologies de la Informació i les Comunicacion
An Empirical Study of Exhaustive Matching for Improving Motion Field Estimation
Optical flow is defined as the motion field of pixels between two consecutive images. Traditionally, in order to estimate pixel motion field (or optical flow), an energy model is proposed. This energy model is composed of (i) a data term and (ii) a regularization term. The data term is an optical flow error estimation and the regularization term imposes spatial smoothness. Traditional variational models use a linearization in the data term. This linearized version of data term fails when the displacement of the object is larger than its own size. Recently, the precision of the optical flow method has been increased due to the use of additional information, obtained from correspondences computed between two images obtained by different methods such as SIFT, deep-matching, and exhaustive search. This work presents an empirical study in order to evaluate different strategies for locating exhaustive correspondences improving flow estimation. We considered a different location for matching random locations, uniform locations, and locations on maximum gradient magnitude. Additionally, we tested the combination of large and medium gradients with uniform locations. We evaluated our methodology in the MPI-Sintel database, which represents the state-of-the-art evaluation databases. Our results in MPI-Sintel show that our proposal outperforms classical methods such as Horn-Schunk, TV-L1, and LDOF, and our method performs similar to MDP-Flow
Some problems in depth enhanced video processing
In this thesis we tackle two problems, namely, the data interpolation prob- lem in the context of depth computation both for images and for videos, and the problem of the estimation of the apparent movement of objects in image sequences. The rst problem deals with completion of depth data in a region of an image or video where data are missing due to occlusions, unreliable data, damage or lost of data during acquisition. In this thesis we tackle it in two ways. First, we propose a non-local gradient-based energy which is able to complete planes locally. We consider this model as an extension of the bilateral lter to the gradient domain. We have successfully evaluated our model to complete synthetic depth images and also incomplete depth maps provided by a Kinect sensor. The second approach to tackle the problem is an experimental study of the Biased Absolutely Minimizing Lipschitz Extension (biased AMLE in short) for anisotropic interpolation of depth data to big empty regions without informa- tion. The AMLE operator is a cone interpolator, but the biased AMLE is an exponential cone interpolator which makes it more addapted to depth maps of real scenes that usually present soft convex or concave surfaces. Moreover, the biased AMLE operator is able to expand depth data to huge regions. By con- sidering the image domain endowed with an anisotropic metric, the proposed method is able to take into account the underlying geometric information in order not to interpolate across the boundary of objects at di erent depths. We have proposed a numerical model to compute the solution of the biased AMLE which is based on the eikonal operators. Additionally, we have extended the proposed numerical model to video sequences. The second problem deals with the motion estimation of the objects in a video sequence. This problem is known as the optical ow computation. The Optical ow problem is one of the most challenging problems in computer vision. Traditional models to estimate it fail in presence of occlusions and non-uniform illumination. To tackle these problems we proposed a variational model to jointly estimate optical ow and occlusion. Moreover, the proposed model is able to deal with the usual drawback of variational methods in dealing with fast displacements of objects in the scene which are larger than the object it- self. The addition of a term that balance gradient and intensities increases the robustness to illumination changes of the proposed model. The inclusions of a supplementary matches given by exhaustive search in speci cs locations helps to follow large displacements.En esta tesis se abordan dos problemas: interpolación de datos en el contexto del cálculo de disparidades tanto para imágenes como para video, y el problema de la estimación del movimiento aparente de objetos en una secuencia de imágenes. El primer problema trata de la completación de datos de profundidad en una región de la imagen o video dónde los datos se han perdido debido a oclusiones, datos no confiables, datos dañados o pérdida de datos durante la adquisición. En esta tesis estos problemas se abordan de dos maneras. Primero, se propone una energía basada en gradientes no-locales, energía que puede (localmente) completar planos. Se considera este modelo como una extensión del filtro bilateral al dominio del gradiente. Se ha evaluado en forma exitosa el modelo para completar datos sintéticos y también mapas de profundidad incompletos de un sensor Kinect. El segundo enfoque, para abordar el problema, es un estudio experimental del biased AMLE (Biased Absolutely Minimizing Lipschitz Extension) para interpolación anisotrópica de datos de profundidad en grandes regiones sin información. El operador AMLE es un interpolador de conos, pero el operador biased AMLE es un interpolador de conos exponenciales lo que lo hace estar más adaptado a mapas de profundidad de escenas reales (las que comunmente presentan superficies convexas, concavas y suaves). Además, el operador biased AMLE puede expandir datos de profundidad a regiones grandes. Considerando al dominio de la imagen dotado de una métrica anisotrópica, el método propuesto puede tomar en cuenta información geométrica subyacente para no interpolar a través de los límites de los objetos a diferentes profundidades. Se ha propuesto un modelo numérico, basado en el operador eikonal, para calcular la solución del biased AMLE. Adicionalmente, se ha extendido el modelo numérico a sequencias de video. El cálculo del flujo óptico es uno de los problemas más desafiantes para la visión por computador. Los modelos tradicionales fallan al estimar el flujo óptico en presencia de oclusiones o iluminación no uniforme. Para abordar este problema se propone un modelo variacional para conjuntamente estimar flujo óptico y oclusiones. Además, el modelo propuesto puede tolerar, una limitación tradicional de los métodos variacionales, desplazamientos rápidos de objetos que son más grandes que el tamaño objeto en la escena. La adición de un término para el balance de gradientes e intensidades aumenta la robustez del modelo propuesto ante cambios de iluminación. La inclusión de correspondencias adicionales (obtenidas usando búsqueda exhaustiva en ubicaciones específicas) ayuda a estimar grandes desplazamientos.Programa de doctorat en Tecnologies de la Informació i les Comunicacion
Seguimiento 3D de Rostros e Iris Mediante Moldes Antropométricos
En el seguimiento de rostros e iris existe una gran cantidad de trabajos publicados, basados
en diferentes técnicas consideras invasivas como: montaje de dispositivos electrónicos
(electrodos, cámaras).
Aprovechando la mayor velocidad de procesamiento alcanzada por los computadores
personales y la disminución de costos de los sistemas de adquisición de video, se han
desarrollado diferentes métodos no invasivos para el seguimiento de iris y rostros.
En el Departamento de Ingeniería Eléctrica de la Universidad de Chile, se desarrolló un
método no invasivo de seguimiento de iris que consiste en tres etapas: detección gruesa de
la posición del rostro, detección fina y estimación del tamaño del rostro, y detección de la
posición y tamaño del iris. La detección gruesa usa la metodología de Maio y Maltoni. La
detección fina se realiza con una integral de línea, utilizando un molde antropométrico del
rostro inclinado en el eje coronal, transversal y sagital, sobre una imagen direccional de
entrada, estimándose así la posición, inclinación y tamaño del rostro. Conociendo estos
valores es posible definir zonas de búsqueda más probables del iris. En la que se busca la
posición y tamaño del iris recorriéndola con unos moldes semicirculares.
Para el desarrollo de los nuevos moldes antropométricos y validación de la metodología, se
construyeron bancos de imágenes estáticas de 5 individuos con rotaciones en el eje
transversal. Los individuos rotaron sus rostros desde -45º a 45º con un paso de 15º. Además
se construyeron 4 secuencias de video para los mismos individuos, que rotan sus rostros en
el eje transversal y coronal. Se construyeron 4 secuencias de video de individuos que rotan
su rostro en el eje sagital. Con estos bancos de imágenes se construyeron modelos
empíricos de la variación de las posiciones de las características antropométricas del rostro
y la excentricidad del rostro, frente a las rotaciones, transversales y sagitales. Finalmente se
construyeron 4 secuencias de video de individuos que rotan su rostro en los 3 ejes.
La metodología desarrollada se evaluó en el banco de secuencias de video para las
rotaciones en los diferentes ejes. Para la rotación transversal se obtuvo que en todas las
secuencias el desempeño es mayor que 89% y en 2 alcanza el 100%. Para el caso de la
detección del iris se observa que el porcentaje de detección correcta fue mayor que 75% y
en 2 secuencias fue mayor que 90%. Para el seguimiento sagital se obtuvo que la detección
de rostros en tres de las secuencias fue más de 89% sólo en una se tiene 78%, en una
alcanza 99%. Para el caso de la detección del iris se observa que el porcentaje de detección
correcta fue mayor que 89% en 3 de las secuencias y en 1 secuencia mayor que 86%. En la
rotación 3D se obtuvo valores de la tasa de detección correcta del rostro en tres secuencias
mayores que 93% y en sólo una es de 18%. La tasa de detección correcta del iris sólo en
una secuencia presenta un valor de 83%, en otra se alcanza 89% y en dos de ellas se
supera el 90% de detección correcta.
La metodología desarrollada para el seguimiento de rostros selectiva en el eje transversal
con un paso de 20º, en el sagital con paso de 20º y en el coronal con paso de 15º.
Se midieron los tiempos de procesamiento para rotaciones coronal-transversal y 3D. Para
estos ejes se obtuvo un tiempo promedio de 0,020 s, y 0,028 s respectivamente, pudiéndose
procesar hasta 50 imágenes y 35 imágenes por segundos respectivamente. Estos tiempos
se midieron en un computador Pentium 4 de 3,2 GHz. Estos resultados permiten aplicar la
metodología en tiempo real
Depth Completion with Anisotropic Metric, Convolutional Stages, and Infinity Laplacian
Depth map estimation is crucial for a wide range of applications. Unfortunately, it often presents missing or unreliable data. The objective of depth completion is to fill in the “holes” in a depth map by propagating the depth information using guidance from other sources of information, such as color. Nowadays, classical image processing methods have been outperformed by deep learning techniques. Nevertheless, these approaches require a significantly large number of images and enormous computing power for training. This fact limits their usability and makes them not the best solution in some resource-constrained environments. Therefore, this paper investigates three simple hybrid models for depth completion. We explore a hybrid pipeline that combines a very efficient and powerful interpolator (infinity Laplacian or AMLE) and a series of convolutional stages. The contributions of this article are (i) the use a Texture+Structuredecomposition as a pre-filter stage; (ii) an objective evaluation with three different approaches using KITTI and NYU_V2 data sets; (iii) the use of an anisotropic metric as a mechanism to improve interpolation; and iv) the inclusion of an ablation test. The main conclusions of this work are that using an anisotropic metric improves model performance, and the ablation test demonstrates that the model’s final stage is a critical component in the pipeline; its suppression leads to an approximate 4% increase in MSE. We also show that our model outperforms state-of-the-art alternatives with similar levels of complexity
