1,721,009 research outputs found
Quelques contributions autour des modèles de mélanges et pour l’analyse de données transcriptomiques
A sparse variable selection procedure in model-based clustering
Au vu de l'augmentation du nombre de jeux de données de grande dimension, la sélection de variables pour la classification non supervisée est un enjeu important. Dans le cadre de la classification par mélanges gaussiens, nous reformulons le problème de sélection de variables en un problème général de sélection de modèle. Dans un premier temps, notre procédure consiste à construire une sous-collection de modèles grâce à une méthode de régularisation l1. Puis, l'estimateur du maximum de vraisemblance est déterminé via un algorithme EM pour chaque modèle. Enfin un critère pénalisé non asymptotique est proposé pour sélectionner à la fois le nombre de composants du mélange et l'ensemble des variables informatives pour la classification. D'un point de vue théorique, un théorème général de sélection de modèles dans le cadre de l'estimation par maximum de vraisemblance avec une collection aléatoire de modèles est établi. Il permet en particulier de justifier la forme de la pénalité de notre critère, forme qui dépend de la complexité de la collection de modèles. En pratique, ce critère est calibré grâce à la méthode dite de l'heuristique de pente. Cette procédure est illustrée sur deux jeux de données simulées. Finalement, une extension, associée à une modélisation plus générale des variables non informatives pour la classification, est proposée
A sparse variable selection procedure in model-based clustering
Au vu de l'augmentation du nombre de jeux de données de grande dimension, la sélection de variables pour la classification non supervisée est un enjeu important. Dans le cadre de la classification par mélanges gaussiens, nous reformulons le problème de sélection de variables en un problème général de sélection de modèle. Dans un premier temps, notre procédure consiste à construire une sous-collection de modèles grâce à une méthode de régularisation l1. Puis, l'estimateur du maximum de vraisemblance est déterminé via un algorithme EM pour chaque modèle. Enfin un critère pénalisé non asymptotique est proposé pour sélectionner à la fois le nombre de composants du mélange et l'ensemble des variables informatives pour la classification. D'un point de vue théorique, un théorème général de sélection de modèles dans le cadre de l'estimation par maximum de vraisemblance avec une collection aléatoire de modèles est établi. Il permet en particulier de justifier la forme de la pénalité de notre critère, forme qui dépend de la complexité de la collection de modèles. En pratique, ce critère est calibré grâce à la méthode dite de l'heuristique de pente. Cette procédure est illustrée sur deux jeux de données simulées. Finalement, une extension, associée à une modélisation plus générale des variables non informatives pour la classification, est proposée
Transformation and model choice for RNA-seq co-expression analysis
International audienceAlthough a large number of clustering algorithms have been proposed to identify groups of co-expressed genes from microarray data, the question of if and how such methods may be applied to RNA sequencing (RNA-seq) data remains unaddressed. In this work, we investigate the use of data transformations in conjunction with Gaussian mixture models for RNA-seq co-expression analyses, as well as a penalized model selection criterion to select both an appropriate transformation and number of clusters present in the data. This approach has the advantage of accounting for per-cluster correlation structures among samples, which can be strong in RNA-seq data. In addition, it provides a rigorous statistical framework for parameter estimation, an objective assessment of data transformations and number of clusters and the possibility of performing diagnostic checks on the quality and homogeneity of the identified clusters. We analyze four varied RNA-seq data sets to illustrate the use of transformations and model selection in conjunction with Gaussian mixture models. Finally, we propose a Bioconductor package coseq (co-expression of RNA-seq data) to facilitate implementation and visualization of the recommended RNA-seq co-expression analyses
Non-asymptotic detection of two-component mixtures with unknown means
International audienceThis work is concerned with the detection of a mixture distribution from a -valued sample. Given a sample and an even density , our aim is to detect whether the sample distribution is for some unknown mean , or is defined as a two-component mixture based on translations of . In a first time, a non-asymptotic testing procedure is proposed and we determine conditions under which the power of the test can be controlled. In a second time, the performances of our testing procedure are investigated in 'benchmark' asymptotic settings. A simulation study provides comparisons with classical procedures
Non-asymptotic detection of two-component mixtures with unknown means
International audienceThis work is concerned with the detection of a mixture distribution from a -valued sample. Given a sample and an even density , our aim is to detect whether the sample distribution is for some unknown mean , or is defined as a two-component mixture based on translations of . In a first time, a non-asymptotic testing procedure is proposed and we determine conditions under which the power of the test can be controlled. In a second time, the performances of our testing procedure are investigated in 'benchmark' asymptotic settings. A simulation study provides comparisons with classical procedures
Non-asymptotic detection of two-component mixtures with unknown means
International audienceThis work is concerned with the detection of a mixture distribution from a -valued sample. Given a sample and an even density , our aim is to detect whether the sample distribution is for some unknown mean , or is defined as a two-component mixture based on translations of . In a first time, a non-asymptotic testing procedure is proposed and we determine conditions under which the power of the test can be controlled. In a second time, the performances of our testing procedure are investigated in 'benchmark' asymptotic settings. A simulation study provides comparisons with classical procedures
Multidimensional two-component Gaussian mixtures detection
International audienceLet be a -dimensional i.i.d sample from a distribution with density . The problem of detection of a two-component mixture is considered. Our aim is to decide whether is the density of a standard Gaussian random -vector () against is a two-component mixture: where are unknown parameters. Optimal separation conditions on and the dimension are established, allowing to separate both hypotheses with prescribed errors. Several testing procedures are proposed and two alternative subsets are considered
- …
