1,721,332 research outputs found
Efficient disparity vector coding for multi-view 3-D displays
Disparity estimation can be used for eliminating redundancies between different views of an object or a scene recorded by an array of cameras which are arranged both horizontally and vertically. However, estimation of the disparity vectors is a highly time consuming process which takes most of the operation time of the multi-view video coding. Therefore, either the amount of data that is to be processed or the complexity of the coding method needs to be decreased in order to encode the multi-view video in a reasonable time. It is proven that the disparities of a point in the scene photographed by cameras which are spaced equidistantly are equal. Since there is a strong geometrical correlation of the disparity vectors, the disparity vector of a view can for most blocks be derived from the disparity vector of another view or views. A new algorithm is presented that reduces the amount of processing time needed for calculating the disparity vectors of each neighboring view except the principal ones. Different schemes are proposed for 3*3 views and they are applied to several image sequences taken from a camera-array. The experimental results show that the proposed schemes yield better results than the reference scheme while preserving the image quality and the amount of encoded data
Shape matching based on a hierarchical skeletonization
Les travaux effectués durant cette thèse portent sur l’appariement de formes planes basé sur une squelettisation hiérarchique. Dans un premier temps, nous avons abordé la création d’un squelette de forme grâce à un algorithme associant des outils de la géométrie discrète et des filtres. Cette association permet d’acquérir un squelette regroupant les propriétés désirées dans le cadre de l’appariement. Néanmoins, le squelette obtenu reste une représentation de la forme ne différenciant pas les branches représentant l’allure générale de celles représentant un détail de la forme. Or, lors de l’appariement, il semble plus intéressant d’associer des branches ayant le même ordre d’importance, mais aussi de donner plus de poids aux associations décrivant un aspect global des formes. Notre deuxième contribution porte sur la résolution de ce problème. Elle concerne donc la hiérarchisation des branches du squelette, précédemment créé, en leur attribuant une pondération reflétant leur importance dans la forme. À cet effet, nous lissons progressivement une forme et étudions la persistance des branches pour leur attribuer un poids. L’ultime étape consiste donc à apparier les formes grâce à leur squelette hiérarchique modélisé par un hypergraphe. En d’autres termes, nous associons les branches deux à deux pour déterminer une mesure de dissimilarité entre deux formes. Pour ce faire, nous prenons en compte la géométrie des formes, la position relative des différentes parties des formes ainsi que de leur importance.The works performed during this thesis focuses on the matching of planar shapes based on a hierarchical skeletonisation. First, we approached the creation of a shape skeleton using an algorithm combining the tools of discrete geometry and filters. This combination allows to acquire a skeleton gathering the desired properties in the context of matching. Nevertheless, the resulting skeleton remains a representation of the shape, which does not differentiate branches representing the general shape of those coming from a detail of the shape. But when matching, it seems more interesting to pair branches of the same order of importance, but also to give more weight to associations describing an overall appearance of shapes. Our second contribution focuses on solving this problem. It concerns the prioritization of skeletal branches, previously created by assigning a weight reflecting their importance in shape. To this end, we gradually smooth a shape and study the persistence of branches to assign a weight. The final step is to match the shapes with their hierarchical skeleton modeled as a hypergraph. In other words, we associate the branches two by two to determine a dissimilarity measure between two shapes. To do this, we take into account the geometry of the shapes, the relative position of different parts of the shapes and their importance
Object classification in images and videos. Application to facial expressions
Dans cette thèse, nous avons abordé la problématique de la classification d\u27objets puis nous l\u27avons appliqué à la classification et la reconnaissance des expressions faciales. D\u27abord, nous nous sommes inspirés des processus de Dirichlet, comme des distributions dans l\u27espace des distributions, qui génèrent des composantes intermédiaires permettant d\u27améliorer la catégorisation d\u27objets. Ce modèle, utilisé notamment dans la classification sémantique de documents, se caractérise par le fait d\u27être non paramétrique, et d\u27être hiérarchique. Dans une première phase, l\u27ensemble des composantes intermédiaires de base sont extraites en utilisant l\u27apprentissage bayésien par MCMC puis une sélection itérative des classifiers faibles les plus distinctifs parmi toutes les composantes est opéré par Adaboost. Notre objectif est de cerner les distributions des composantes latentes aussi bien celles partagées par les différentes classes que celles associées à une catégorie particulière. Nous avons cherché dans cette seconde partie à appliquer notre approche de classification aux expressions faciales. Ce travail a consisté à trouver les méthodes adéquates pour décrire les aspects statiques et dynamiques au cours de l\u27expression faciale, et donc à concevoir de nouveaux descripteurs capables de représenter les caractéristiques des mouvements des muscles faciaux, et par là même, identifier la catégorie de l\u27expression
Recherche par similarité dans les bases de données multimédia : application à la recherche par le contenu d\u27images
L\u27émergence des données numériques multimédia ne cesse d\u27augmenter. l\u27accès, le partage, le stockage et la recherche de ces données sont devenues des besoins réels et les problématiques sont nombreuses et variées. Afin de rendre cette masse d\u27information facilement exploitable pour tout utilisateur, il est nécessaire de disposer de techniques d\u27indexation et de recherche rapides et efficaces. Mes travaux de thèse s\u27inscrivent dans le domaine des données multimédia et plus précisément des images fixes. L\u27objectif principal est de développer une méthode performante d\u27indexation et de recherche des k plus proches voisins (kppv) qui soit adaptée à la recherche d\u27image par le contenu et aux propriétés des descripteurs d\u27images (grand volume, grande dimension, hétérogénéité, etc.). il s\u27agit d\u27une part, d\u27apporter des réponses aux problèmes de passage à l\u27échelle et de la malédiction de la dimension et d\u27autre part de traiter les problèmes de mesure de similarité qui se posent, et qui sont liés à la nature des données manipulées. Notre première proposition consiste en l\u27utilisation d\u27une structure d\u27indexation multidimensionnelle basée sur l\u27approximation ou filtrage, par une amélioration de la méthode RA-Blocks. Elle repose sur un algorithme de découpage de l\u27espace de données qui améliore notablement la capacité de stockage de l\u27index ainsi que le temps de la recherche. Dans un deuxième temps, nous proposons une méthode d\u27indexation multidimensionnelle adaptée à des données hétérogènes (couleur, texture, forme). Notre méthode combine une technique non linéaire de la réduction de la dimension à une structure d\u27indexation multidimensionnelle basée sur l\u27approche approximation. Cette combinaison permet de répondre à travers, un formaliste unique, aux différents verrous que nous nous sommes fixés de lever
Indexation d\u27images 2D. Vers une reconnaissance d\u27objets multi-critères
D\u27importants volumes d\u27images numériques, conduisent aujourd\u27hui à une forte demande d\u27outils permettant d\u27indexer puis de rechercher une image. Indexer une image consiste à en extraire une signature. Rechercher une image dans une base consiste alors à comparer plusieurs signatures entre elles. Une indexation est dite basée sur le contenu lorsqu\u27elle utilise les données de bas niveau (couleur, texture) de l\u27image pour construire la signature.
De tels système sont faces à une limitation fondamentale : ils permettent aux utilisateurs de rechercher des images d\u27après leurs caractéristiques de bas niveaux (matière) alors ces derniers préfèreraient une recherche plus sémantique, relative à ce que l\u27image décrit (les objets présents, par exemple). Ainsi, l\u27indexation basée sur le contenu se doit de trouver des outils pour réduire le fossé entre les données de bas niveau et la sémantique. Même si un tel lien n\u27existe pas forcément, l\u27utilisation de données structurelles peut permettre une première avancée. En outre, les systèmes d\u27indexation doivent proposer des interfaces capables d\u27aider l\u27utilisateur à formuler des requêtes correspondant à ce qu\u27il recherche. Le paradigme classique consiste à fournir au système une image exemple. Néanmoins, cette approche reste limitée car il est difficile de pouvoir généraliser à partir de l\u27exemple ce que cherche réellement l\u27utilisateur. Dans cette thèse, nous proposons un système d\u27indexation qui permet de réduire le fossé entre les données de bas niveau et la sémantique. Tout d\u27abord, l\u27utilisateur formule, lors de la requête, un modèle (prototype) de l\u27objet recherché. Lors de la comparaison, entre ce modèle et les images de la base, plusieurs critères sont utilisés, comme la forme mais aussi l\u27organisation spatiale de différentes zones d\u27intérêt. Une étape cruciale consiste justement à extraire de telles zones d\u27intérêt. Les approches de segmentation sont souvent entachées d\u27erreur, notamment à cause de variation d\u27éclairage dans la scène. Nous proposons donc de ne pas décrire une image par une segmentation unique mais plutôt par une hiérarchie de segmentations. Celle-ci représente l\u27image à différents niveaux de détails et se construit à partir de regroupements successifs de régions (groupements perceptuels), basés à la fois sur des critères de bas niveaux mais aussi géométriques. Durant la comparaison entre un modèle et une image, nous considérons les correspondances entre chacune des parties au lieu d\u27utiliser seulement le modèle dans sa globalité. Plus précisément, la correspondance prend en compte les formes des parties, à travers les descripteurs ART (Angular Radial Transform) et CSS (Curvature Scale Space). En outre, l\u27organisation spatiale des parties entre elles est également prise en compte. Toutes ces caractéristiques sont combinées entre elles, par la théorie de l\u27évidence de Shafer afin d\u27en déduire une mesure unique de similarité
Tatouage informé et compression multi-sources
Les avancées technologiques qu\u27ont connu les télécommunications, le multimédia et les systèmes mobiles ont ouvert la porte à l\u27émergence, puis au développement de nouveaux services tels que le partage de bases de données multimédia, la vidéo- conférence ou la protection des contenus, tout en utilisant des systèmes à faible puissance. D\u27où la nécessité de disposer de nouvelles techniques de codage à complexité réduite. Les techniques de codage exploitant la présence d\u27une information parallèle peuvent constituer une solution potentielle permettant de déporter la complexité de codage vers le décodeur. Celles-ci s\u27appliquent notamment à deux principes de codage : 1) Le codage de source distribué (Distributed Source Coding DSC) pour compresser un signal donné, sachant qu\u27un autre signal corrélé à celui d\u27origine est disponible au niveau du décodeur. 2) La dissimulation de données informée (Informed Data Hiding IDH) permettant d\u27insérer un message dans un signal hôte, ce dernier n\u27étant connu qu\u27au codeur. Pour chacune de ces deux techniques, nous proposons des solutions qui approchent les limites théoriques. Nous combinons pour cela des techniques performantes tant de codage canal, de type LDPC, que de quantification de type Treillis (TCQ). Par ailleurs, nous étudions les limites théoriques pouvant être atteintes par IDH, dans le cas où une version bruitée du signal hôte est disponible au décodeur. Enfin, exploitant la forte dualité qui existe entre DSC et IDH, nous proposons un schéma pratique hybride complet mettant en oeuvre les deux techniques, ainsi qu\u27une étude théorique de la fonction débit / distorsion et de la capacité d\u27un tel système
Développement d’agents autonomes avec des politiques de navigation hybrides
Les progrès récents de l’IA, et plus particulièrement de l’apprentissage automatique, permettent aux robots de s’intégrer de manière plus transparente dans nos habitudes quotidiennes. L’objectif de cette thèse est de faire un pas de plus vers le développement d’agents autonomes intelligents qui peuvent être intégrés dans notre environnement quotidien, comme les maisons, les hôpitaux, les centres commerciaux, etc. Ces agents devraient posséder la capacité de naviguer efficacement dans leur environnement pour atteindre un certain objectif, comme atteindre une certaine zone de l’environnement ou trouver un certain objet. C’est pourquoi nous examinons le large éventail de techniques existantes pour la construction d’un agent de navigation incarné. Ces techniques peuvent entièrement être apprises par des réseaux neuronaux (techniques basées sur l’apprentissage) ou elles peuvent être des techniques fondées sur la géométrie qui reposent sur une modélisation explicite de l’agent et de son environnement. Dans cette thèse, nous construisons des approches hybrides qui utilisent les deux techniques afin de pouvoir fonctionner, non seulement dans une simulation, mais également dans un environnement physique réel. Il s’agit d’un objectif commun dans toutes les contributions de cette thèse.Recent advancements in AI, and specifically Machine Learning, are enabling robots to more seamlessly integrate into our everyday routines. The objective of this thesis is to take a further step towards the development of intelligent autonomous agents that can be embedded in our daily environment, such as houses, hospitals, shopping malls, and so forth. These agents ought to possess the capability to effectively navigate their surroundings to achieve a certain target, such as reaching a certain place in the environment or finding a certain object. Therefore, we examine a wide range of existing techniques for building an embodied navigation agent. These techniques can be fully learned by neural networks (learned-based techniques) or they can be based on geometry techniques that rely on explicit modeling of the agent and its environment. In this thesis, we build hybrid approaches that use both techniques in such a way that they can work not only in a simulation but also in a real physical environment. This is a common goal for all the contributions to this thesis
- …
