1,721,009 research outputs found

    A sparse variable selection procedure in model-based clustering

    No full text
    Au vu de l'augmentation du nombre de jeux de données de grande dimension, la sélection de variables pour la classification non supervisée est un enjeu important. Dans le cadre de la classification par mélanges gaussiens, nous reformulons le problème de sélection de variables en un problème général de sélection de modèle. Dans un premier temps, notre procédure consiste à construire une sous-collection de modèles grâce à une méthode de régularisation l1. Puis, l'estimateur du maximum de vraisemblance est déterminé via un algorithme EM pour chaque modèle. Enfin un critère pénalisé non asymptotique est proposé pour sélectionner à la fois le nombre de composants du mélange et l'ensemble des variables informatives pour la classification. D'un point de vue théorique, un théorème général de sélection de modèles dans le cadre de l'estimation par maximum de vraisemblance avec une collection aléatoire de modèles est établi. Il permet en particulier de justifier la forme de la pénalité de notre critère, forme qui dépend de la complexité de la collection de modèles. En pratique, ce critère est calibré grâce à la méthode dite de l'heuristique de pente. Cette procédure est illustrée sur deux jeux de données simulées. Finalement, une extension, associée à une modélisation plus générale des variables non informatives pour la classification, est proposée

    A sparse variable selection procedure in model-based clustering

    No full text
    Au vu de l'augmentation du nombre de jeux de données de grande dimension, la sélection de variables pour la classification non supervisée est un enjeu important. Dans le cadre de la classification par mélanges gaussiens, nous reformulons le problème de sélection de variables en un problème général de sélection de modèle. Dans un premier temps, notre procédure consiste à construire une sous-collection de modèles grâce à une méthode de régularisation l1. Puis, l'estimateur du maximum de vraisemblance est déterminé via un algorithme EM pour chaque modèle. Enfin un critère pénalisé non asymptotique est proposé pour sélectionner à la fois le nombre de composants du mélange et l'ensemble des variables informatives pour la classification. D'un point de vue théorique, un théorème général de sélection de modèles dans le cadre de l'estimation par maximum de vraisemblance avec une collection aléatoire de modèles est établi. Il permet en particulier de justifier la forme de la pénalité de notre critère, forme qui dépend de la complexité de la collection de modèles. En pratique, ce critère est calibré grâce à la méthode dite de l'heuristique de pente. Cette procédure est illustrée sur deux jeux de données simulées. Finalement, une extension, associée à une modélisation plus générale des variables non informatives pour la classification, est proposée

    Adaptive density estimation using finite Gaussian mixtures

    No full text
    International audienc

    Transformation and model choice for RNA-seq co-expression analysis

    No full text
    International audienceAlthough a large number of clustering algorithms have been proposed to identify groups of co-expressed genes from microarray data, the question of if and how such methods may be applied to RNA sequencing (RNA-seq) data remains unaddressed. In this work, we investigate the use of data transformations in conjunction with Gaussian mixture models for RNA-seq co-expression analyses, as well as a penalized model selection criterion to select both an appropriate transformation and number of clusters present in the data. This approach has the advantage of accounting for per-cluster correlation structures among samples, which can be strong in RNA-seq data. In addition, it provides a rigorous statistical framework for parameter estimation, an objective assessment of data transformations and number of clusters and the possibility of performing diagnostic checks on the quality and homogeneity of the identified clusters. We analyze four varied RNA-seq data sets to illustrate the use of transformations and model selection in conjunction with Gaussian mixture models. Finally, we propose a Bioconductor package coseq (co-expression of RNA-seq data) to facilitate implementation and visualization of the recommended RNA-seq co-expression analyses

    Non-asymptotic detection of two-component mixtures with unknown means

    No full text
    International audienceThis work is concerned with the detection of a mixture distribution from a R\mathbb{R}-valued sample. Given a sample X1,,XnX_1,\dots, X_n and an even density ϕ\phi, our aim is to detect whether the sample distribution is ϕ(.μ)\phi(.-\mu) for some unknown mean μ\mu, or is defined as a two-component mixture based on translations of ϕ\phi. In a first time, a non-asymptotic testing procedure is proposed and we determine conditions under which the power of the test can be controlled. In a second time, the performances of our testing procedure are investigated in 'benchmark' asymptotic settings. A simulation study provides comparisons with classical procedures

    Non-asymptotic detection of two-component mixtures with unknown means

    No full text
    International audienceThis work is concerned with the detection of a mixture distribution from a R\mathbb{R}-valued sample. Given a sample X1,,XnX_1,\dots, X_n and an even density ϕ\phi, our aim is to detect whether the sample distribution is ϕ(.μ)\phi(.-\mu) for some unknown mean μ\mu, or is defined as a two-component mixture based on translations of ϕ\phi. In a first time, a non-asymptotic testing procedure is proposed and we determine conditions under which the power of the test can be controlled. In a second time, the performances of our testing procedure are investigated in 'benchmark' asymptotic settings. A simulation study provides comparisons with classical procedures

    Non-asymptotic detection of two-component mixtures with unknown means

    No full text
    International audienceThis work is concerned with the detection of a mixture distribution from a R\mathbb{R}-valued sample. Given a sample X1,,XnX_1,\dots, X_n and an even density ϕ\phi, our aim is to detect whether the sample distribution is ϕ(.μ)\phi(.-\mu) for some unknown mean μ\mu, or is defined as a two-component mixture based on translations of ϕ\phi. In a first time, a non-asymptotic testing procedure is proposed and we determine conditions under which the power of the test can be controlled. In a second time, the performances of our testing procedure are investigated in 'benchmark' asymptotic settings. A simulation study provides comparisons with classical procedures

    Multidimensional two-component Gaussian mixtures detection

    No full text
    International audienceLet (X1,,Xn)(X_1,\ldots,X_n) be a dd-dimensional i.i.d sample from a distribution with density ff. The problem of detection of a two-component mixture is considered. Our aim is to decide whether ff is the density of a standard Gaussian random dd-vector (f=ϕdf=\phi_d) against ff is a two-component mixture: f=(1ε)ϕd+εϕd(.μ)f=(1-\varepsilon)\phi_d +\varepsilon \phi_d (.-\mu) where (ε,μ)(\varepsilon,\mu) are unknown parameters. Optimal separation conditions on ε,μ,n\varepsilon, \mu, n and the dimension dd are established, allowing to separate both hypotheses with prescribed errors. Several testing procedures are proposed and two alternative subsets are considered
    corecore