1,720,989 research outputs found
The new family of generalized odd log-logistic distributions: applications in survival analysis
O presente trabalho propõe uma classe de modelos que se baseia numa família de distribuições contínuas, intitulada de odd log-logística generalizada, considerando alguns cenários que ocorrem com frequência na análise de sobrevivência. Inicialmente, apresenta-se uma nova família de modelos de sobrevivência denominada Neyman tipo A odd log-logística generalizada de longa duração. Esta, fundamenta-se nos diferentes esquemas de ativação em que a quantidade de fatores se adéqua a uma distribuição discreta Neyman tipo A e o tempo até a ocorrência do evento segue uma família de distribuições contínuas odd log-logística generalizada. A metodologia apresentada também é aplicada de forma similar na presença das covariáveis por meio do modelo de regressão. Além disso, é comum em situações práticas que existam dados de sobrevida com informações na censura. Assim, outro objetivo deste trabalho é introduzir a família odd log-logística generalizada no contexto de censura informativa. O modelo proposto se fundamenta na suposição de que os tempos de falha e de censura são condicionalmente independentes dada uma fragilidade, na qual as variáveis de censura e fragilidade se ajustam às distribuições odd log-logística generalizada e gama, respectivamente. Tal metodologia também se aplica de maneira análoga através do modelo de regressão. O último enfoque abordado é a utilização da família odd log-logística generalizada na presença da censura intervalar tanto na ausência, quanto na presença de covariáveis por meio do modelo de regressão. A escolha deste mecanismo de censura é adequado quando o tempos exatos de falha não são conhecidos, sabendo-se apenas que os mesmos ocorreram dentro de um intervalo de tempo e não em um ponto específico. As análises clássica e Bayesiana são utilizadas para a estimação dos parâmetros dos modelos. Realiza-se diferentes estudos de simulação com o intuito de estudar a média, o viés e a raiz do erro quadrático médio das estimativas de máxima verossimilhança dos modelos nos diferentes esquemas de ativação, valores de parâmetros, tamanhos de amostra e percentuais de censura. Critérios de seleção de modelos também são aplicados, além das técnicas gráficas como TTT-Plot e Kaplan-Meier. Utiliza-se as análises de sensibilidade e de resíduos para verificar as suposições do modelo de regressão. Por fim, conjuntos de dados reais são apresentados para demonstrar a adequabilidade dessa família.The present work proposes a class of models that are based on a continuous distributions family, called generalized odd log-logistic, considering some scenarios that frequently occur in the survival analysis. Initially, a new family of survival models is presented and entitled Neyman type A generalized odd log-logistic-G-family with cure fraction. This model is based on different activation schemes in which the number of factors fits a discrete Neyman type A distribution and the time until the occurrence of the event follows a family of generalized odd log-logistic continuous distributions. The presented methodology is also applied in a similar way in the presence of the covariates through the regression model. Furthermore, it is common in practical situations that there are survival data with information in the censoring. Thus, another objective of this work is to introduce the generalized odd log-logistic family in the context of informative censoring. The proposed model is founded upon the assumption that failure and censorship times are conditionally independent given a fragility, in which the variables of censorship and fragility fit the generalized odd log-logistic and Gamma distributions, respectively. Such methodology is also applied in an analogous form through the regression model. The last approach addressed is the use of the generalized odd-log-logistics family in the presence of interval censorship, both in the absence and in the presence of covariates, via the regression model. The choice of this censorship mechanism is suitable when the exact failure times are not known, knowing only that they occurred within a time interval and not at a specific point. The classical and bayesian analyzes are used to estimate the model parameters. Different simulation studies were carried out in order to study the means, the bias and the root of the mean square error of the maximum likelihood estimates of the models in the different activation schemes, parameter values, sample sizes and censorship levels. Model selection criteria are also applied, in addition to graphic techniques such as TTT-Plot and Kaplan-Meier. Sensitivity and residual analyzes are used to verify the assumptions of the regression model. Finally, real data sets are used to demonstrate the suitability of this family
O modelo de regressão paramétrico, semiparamétrico e de efeito aleatório baseado na extensão da distribuição Gaussiana inversa generalizada
We propose a regression model based on the four-parameter distribution called generalized inverse Gaussian odd log-logistic (OLLGIG) with two systematic components suitable for unimodal and bimodal data that extends the heteroscedastic GIG regression model. Additive, partial or semi-parametric regression models can be an option when the response variable and the explanatory variable have a nonlinear relationship, that is, the fundamental assumption of linearity between these variables does not hold. With this in mind, three flexible models are proposed, namely additive, partial and semiparametric regression models based on the OLLGIG distribution with a systematic structure, considering three different types of penalized smoothings generated by splines. Many studies in the areas of public health, economics, agronomics, medicine, biology and social sciences, among others, involve repeated observations of a response variable. The expression \"repeated measures\" is used to designate measurements obtained for the same variable or in the same experimental unit on more than one occasion. Various experimental designs with repeated measurements exist, such as split-plot, crossover and longitudinal. These types of investigations are called studies of correlated data and play a fundamental role in the analysis of results, where it is possible to characterize changes in the characteristics of an individual by associating these variations to a set of covariates. Due to their nature, the repeated measures have a correlation structure that plays an important role in the analysis of these types of data. In addition, the distribution of the response variable may present asymmetry or bimodality. Thus, a regression with a normal random intercept is introduced based on the OLLGIG distribution. In linear and random regressions, the maximum likelihood method is adopted for the models: additive, partial and semiparametric OLLGIG and the penalized maximum likelihood method are used to estimate the parameters of the proposed models. In addition, several simulations are performed for different parameter configurations and sample sizes to verify the accuracy of the maximum likelihood and penalized maximum likelihood estimators. Diagnostic analyses based on case-deletion and quantile residuals are performed. To prove the potential of the proposed regression models, adjustments are made with real data.Propomos um modelo de regressão baseado na distribuição de quatro parâmetros denominada odd log-logistic Gaussiana inversa generalizada (OLLGIG) com dois componentes sistemáticos adequados para dados unimodais e bimodais que estendam o modelo de regressão GIG heterocedástico. Os modelos de regressão aditivo, parcial ou semiparamétrico podem ser uma opção quando a variável resposta e a variável explicativa tem uma relação não linear, ou seja, não é mais levado em conta uma pressuposição fundamental de linearidade entre essas variáveis. Pensando nisso é proposto três modelos flexíveis denominados de modelos de regressão aditivo, parcial e semiparamétrico baseado na distribuição OLLGIG com uma estrutura sistemática, considerando três diferentes tipos de suavizações penalizadas gerados por splines. Muitos estudos nas áreas de saúde pública, economia, agronomia, medicina, biologia e ciências sociais, entre outros, envolvem observações repetidas de uma variável resposta. A expressão \"medidas repetidas\" é utilizada para designar medidas obtidas para a mesma variável ou na mesma unidade experimental em mais de uma ocasião. Vários projetos experimentais com medidas repetidas são comuns, como split-plot, crossover e longitudinal. Esses tipos de investigações são denominados estudos de dados correlacionados e desempenham um papel fundamental na análise dos resultados, onde é possível caracterizar alterações nas características de um indivíduo, associando essas variações a um conjunto de covariáveis. Devido à sua natureza, as medidas repetidas possuem uma estrutura de correlação que desempenha um papel importante na análise desses tipos de dados, além disso, a distribuição da variável resposta pode apresentar assimetria ou bimodalidade. Assim, é introduzida uma regressão com intercepto aleatório normal com base na distribuição OLLGIG. Na regressão linear e com efeito aleatório e adotado o método de máxima verossimilhança, já para os modelos: aditivo, parcial e semiparamétrico OLLGIG e utilizado o método de máxima verossimilhança penalizada para estimar os parâmetros dos modelos propostos. Além disso, diversas simulações são realizadas para diferentes configurações de parâmetros e tamanhos de amostras para verificar a precisão dos estimadores de máxima verossimilhança e máxima verossimilhança penalizada. São realizadas análises de diagnósticos baseada em case-deletion e resíduos quantílicos. Para comprovar a potencialidade dos modelos de regressão propostos, são realizados ajustes com dados reais
Extensions and contributions to the cure fraction regression models
Modelos de sobrevivência com fração de cura consideram que a população estudada inclui uma fração dessa população suscetível ao evento sob estudo e outra fração de indivíduos imunes ao evento, que pode ser observado quando o tempo de observação é suficientemente longo. Devido a essa particularidade, a análise da qualidade de ajuste desses modelos exige a adaptação de métodos e técnicas de diagnóstico, com base nos procedimentos utilizados em modelos de sobrevivência usuais. Neste trabalho, propomos novos modelos e métodos de avaliação do ajuste de modelos com fração de cura com e sem fragilidade, considerando censura à direita e intervalar. Nossas propostas incluem a formulação de modelos específicos, o uso de resíduos tipo Cox-Snell e resíduos quantílicos aleatorizados, visando facilitar a escolha do modelo adequado. Realizamos estudos de simulação em diferentes cenários e aplicamos os modelos e técnicas de diagnóstico propostos a vários conjuntos de dados reais. Os resultados indicam a relevância dos modelos desenvolvidos e a eficácia das técnicas de diagnóstico sugeridas, evidenciando sua aplicabilidade e potencial nas mais diversas análises.Cure fraction survival models assume that the studied population includes a fraction susceptible to the event under study and another fraction of individuals immune to the event, which can be observed when the observation period is suiciently long. Due to this particularity, assessing the goodness-of-fit of these models requires adapting diagnostic methods and techniques based on those used in standard survival models. In this study, we propose new models and methods for evaluating the fit of cure fraction models, both with and without frailty, considering right-censored and interval-censored data. Our proposals include the development of specific model formulations, the use of Cox-Snell residuals, and randomized quantile residuals to facilitate the selection of appropriate models. We conducted simulation studies across different scenarios and applied the proposed models and diagnostic techniques to various real-world datasets. The results demonstrate the relevance of the developed models and the effectiveness of the suggested diagnostic methods, highlighting their applicability and potential for diverse analytical contexts
Novos modelos flexíveis paramétricos e semi-paramétricos para análise de sobrevivência
In this work was proposed a new distributions, called log-sinh Cauchy, with has bimodal shapes and can be used as alternative to the mixture models. Based in the proposed distribution, the following models were proposed: Regression model based in the GAMLSS framework; models with cure rate based in the mixture and promotion time models; semiparametric models, modeling the parameters using penalized splies; semiparametric models, using the penalized splines to model the non-linear effects present in the cure rate. For all proposed models, the computational codes were implemented in the R software, with is available along of the document as well as some brief introduction on how to use them.Nesse trabalho foi proposto uma nova distribuição, denominada de exponentiated log-sinh Cauchy, a qual possui densidades bimodais e pode ser utilizada como alternativa aos modelos de mistura. Com base na nova distribuição, foram propostos: modelos de regressão baseados nos modelos GAMLSS; modelos com fração de cura baseados em modelos de mistura e tempo de promoção; modelo semi-paramétrico modelando os parâmetros com splines penalizados; modelo semi-paramétrico com fração de cura utilizando splines para modelar efeitos não lineares na proporção de curados. Para todos os modelos propostos, toda parte computacional foi implementada no software R, sendo disponibilizada ao longo do documento assim como breve descrições de uso
Extensões do normal distribuição utilizando a família odd log-logística: teoria e aplicações
In this study we propose three new distributions and a study with longitudinal data. The first was the Odd log-logistic normal distribution: theory and applications in analysis of experiments, the second was Odd log-logistic t Student: theory and applications, the third was the Odd log-logistic skew normal: the new distribution skew-bimodal with applications in analysis of experiments and the fourth regression model with random effect of the Odd log-logistic skew normal distribution: an application in longitudinal data. Some have been demonstrated such as symmetry, quantile function, some expansions, ordinary incomplete moments, mean deviation and the moment generating function. The estimation of the model parameters were approached by the method of maximum likelihood. In applications were used regression models to data from a completely randomized design (CRD) or designs completely randomized in blocks (DBC). Thus, the models can be used in practical situations for as a completely randomized designs or completely randomized blocks designs, mainly, with evidence of asymmetry, kurtosis and bimodality.A distribuição normal é uma das mais importantes na área de estatística. Porém, não é adequada para ajustar dados que apresentam características de assimetria ou de bimodalidade, uma vez que tal distribuição possui apenas os dois primeiros momentos, diferentes de zero, ou seja, a média e o desvio-padrão. Por isso, muitos estudos são realizados com a finalidade de criar novas famílias de distribuições que possam modelar ou a assimetria ou a curtose ou a bimodalidade dos dados. Neste sentido, é importante que estas novas distribuições tenham boas propriedades matemáticas e, também, a distribuição normal como um submodelo. Porém, ainda, são poucas as classes de distribuições que incluem a distribuição normal como um modelo encaixado. Dentre essas propostas destacam-se: a skew-normal, a beta-normal, a Kumarassuamy-normal e a gama-normal. Em 2013 foi proposta a nova família X de distribuições Odd log-logística-G com o objetivo de criar novas distribuições de probabildade. Assim, utilizando as distribuições normal e a skew-normal como função base foram propostas três novas distribuições e um quarto estudo com dados longitudinais. A primeira, foi a distribuição Odd log-logística normal: teoria e aplicações em dados de ensaios experimentais; a segunda foi a distribuição Odd log-logística t Student: teoria e aplicações; a terceira foi a distribuição Odd log-logística skew-bimodal com aplicações em dados de ensaios experimentais e o quarto estudo foi o modelo de regressão com efeito aleatório para a distribuição distribuição Odd log-logística skew-bimodal: uma aplicação em dados longitudinais. Estas distribuições apresentam boas propriedades tais como: assimetria, curtose e bimodalidade. Algumas delas foram demonstradas como: simetria, função quantílica, algumas expansões, os momentos incompletos ordinários, desvios médios e a função geradora de momentos. A flexibilidade das novas distrições foram comparada com os modelos: skew-normal, beta-normal, Kumarassuamy-normal e gama-normal. A estimativas dos parâmetros dos modelos foram obtidas pelo método da máxima verossimilhança. Nas aplicações foram utilizados modelos de regressão para dados provenientes de delineamentos inteiramente casualizados (DIC) ou delineamentos casualizados em blocos (DBC). Além disso, para os novos modelos, foram realizados estudos de simulação para verificar as propriedades assintóticas das estimativas de parâmetros. Para verificar a presença de valores extremos e a qualidade dos ajustes foram propostos os resíduos quantílicos e a análise de sensibilidade. Portanto, os novos modelos estão fundamentados em propriedades matemáticas, estudos de simulação computacional e com aplicações para dados de delineamentos experimentais. Podem ser utilizados em ensaios inteiramente casualizados ou em blocos casualizados, principalmente, com dados que apresentem evidências de assimetria, curtose e bimodalidade
New regression models and machine learning algorithms: theory and applications
Neste trabalho são definidos novos modelos de regressão, baseados na família de distribuições exponentiated odd log-logistic (EOLL-G). Esta família possui a flexibilidade de modelar dados bimodais, simétricos ou assimétricos. Utilizando a distribuição Normal como base, são propostos um modelo de regressão quantílica e um modelo de regressão parcialmente linear. Duas novas famílias bivariadas são definidas a partir da família EOLL-G e utilizando as cópulas de Clayton e de Frank. Dois modelos para dados censurados são propostos utilizando como base as distribuições Weibull e generalized Rayleigh. O desempenho preditivo do modelo parcialmente linear e de um dos modelos para dados censurados é comparado com algoritmos de aprendizado de máquinas: árvores de decisão, florestas aleatórias e florestas aleatórias de sobrevivência. Propriedades estruturais das novas distribuições foram fornecidas, que exibem a flexibilidade da família utilizada e podem ser úteis para trabalhos futuros. O método de máxima verossimilhança foi utilizado para estimação dos parâmetros e estudos de simulações para ambos os modelos são realizados, comprovando a consistência das estimativas. Diversas aplicações são realizadas ilustrando a utilidade dos novos modelos. Quanto à capacidade preditiva, eles mostraram-se competitivos aos algoritmos de aprendizado de máquina, de acordo com os estudos de simulações e com as aplicações realizadas.In this work, new regression models are defined, based on exponentiated odd log-logistic-G (EOLL-G) family of distributions. This family has the flexibility to model bimodal, symmetric or asymmetric data. Using the Normal distribution as a basis, a quantile regression model and a partially linear regression model are proposed. Two new bivariate families are defined based on the EOLL-G family and using the Clayton and Frank copulas. Two models for censored data are proposed using the Weibull and generalized Rayleigh distributions as a basis. The predictive performance of the partially linear model and one of the models for censored data is compared with machine learning algorithms: decision trees, random forests and random survival forests. Structural properties of the new distributions were provided, which exhibit the flexibility of the family used and may be useful for future work. The maximum likelihood method was used to estimate the parameters and simulation studies for both models were carried out, proving the consistency of the estimates. Several applications are carried out illustrating the usefulness of the new models. As for predictive capacity, they proved to be competitive with machine learning algorithms, according to simulation studies and the applications carried out
Modelos de regressão parametricos e semiparametricos baseados na família generalizada odd log-logística
In this work, several analyzes were performed through regression models considering the family of new distributions, called generalized odd log-logistic-G (GOLL-G), the distributions in this family have greater flexibility, such as functions of bimodal densities. Based on the GOLL-G family, we proposed: regression models with different regression structures; inflated semi-parametric model of zeros modeling of the parameters via penalized splines; For all the modeling approaches presented, the computational resource for the implementation of the models was software R, throughout the document as well as brief descriptions of the codes used. The results obtained in the applications show that the proposed model can be an interesting alternative, especially when the data present asymmetry and bimodality.Nesse trabalho foram realizadas diferentes análises via modelos de regressão considerando a família geradora de novas distribuições, denominada de generalizada odd log-logística-G (GOLL-G). As distribuições nesta família apresentam maior flexibilidade, como por exemplo, funções de densidades bimodais. Com base na família GOLL-G, foram propostos: modelos de regressão com diferentes estruturas de regressão; modelo semi-paramétrico inflacionado de zeros modelando os parâmetros via splines penalizados; Para todas as abordagens o recurso computacional para implementação dos modelos foi o software R, sendo apresentados trechos de comandos ao longo do documento assim como breve descrições dos códigos usados. Os resultados obtidos nas aplicações mostram que o modelo proposto pode ser uma alternativa interessante, principalmente quando os dados apresentam assimetria e bimodalidade
The new family of odd log-logistic distributions: theory and applications
Neste trabalho, foi proposta uma nova família de distribuições, a qual permite modelar dados de sobrevivência quando a função de risco tem formas unimodal e U (banheira). Ainda, foram consideradas as modificações das distribuições Weibull, Fréchet, half-normal generalizada, log-logística e lognormal. Tomando dados não-censurados e censurados, considerou-se os estimadores de máxima verossimilhança para o modelo proposto, a fim de verificar a flexibilidade da nova família. Além disso, um modelo de regressão locação-escala foi utilizado para verificar a influência de covariáveis nos tempos de sobrevida. Adicionalmente, conduziu-se uma análise de resíduos baseada nos resíduos deviance modificada. Estudos de simulação, utilizando-se de diferentes atribuições dos parâmetros, porcentagens de censura e tamanhos amostrais, foram conduzidos com o objetivo de verificar a distribuição empírica dos resíduos tipo martingale e deviance modificada. Para detectar observações influentes, foram utilizadas medidas de influência local, que são medidas de diagnóstico baseadas em pequenas perturbações nos dados ou no modelo proposto. Podem ocorrer situações em que a suposição de independência entre os tempos de falha e censura não seja válida. Assim, outro objetivo desse trabalho é considerar o mecanismo de censura informativa, baseado na verossimilhança marginal, considerando a distribuição log-odd log-logística Weibull na modelagem. Por fim, as metodologias descritas são aplicadas a conjuntos de dados reais.In this study, a new family of distributions was proposed, which allows to model survival data when the function of risk has unimodal shapes and U (bathtub). Modifications of the Weibull, Fréchet, generalized half-normal, log-logistic and lognormal distributions were considered. Taking censored and non-censored data, we consider the maximum likelihood estimators for the proposed model, in order to check the flexibility of the new family. Also, it was considered a location-scale regression model, to verify the influence of covariates on survival times. Additionally, a residual analysis was conducted based on modified deviance residuals. For different parameters fixed, percentages of censoring and sample sizes, several simulation studies were performed with the objective of verify the empirical distribution of the martingale type and modified deviance residuals. To detect influential observations, measures of local influence were used, which are diagnostic measures based on small perturbations in the data or in the proposed model. It can occur situations in which the assumption of independence between the failure and censoring times is not valid. Thus, another objective of this work is to consider the informative censoring mechanism based on the marginal likelihood, considering the log-odd log-logistic Weibull distribution in modelling. Finally, the methodologies described are applied to sets of real data
Modelos de preferencia via escalonamento multidimensional
Orientador: Regina C. C. P. MoranDissertação (mestrado) - Universidade Estadual de Campinas, Instituto de Matematica, Estatistica e Computação CientificaResumo: o trabalho tem por objetivo principal estudar os Modelos de Preferência via Escalonamento Multidimensional, isto é, utilizar as dimensões obtidas mediante a técnica do Escalonamento Multidimensional após o processo de interpretação, as quais são consideradas novas variáveis não. observáveis, como variáveis independentes nos Modelos de Preferência. A idéia destes últimos é a partir de modelagem de cada resposta individual de preferência, posicionar o indivíduo no que será chamado espaço dos estímulos. Estas posiciones são conhecidas como Pontos Ideais, onde cada indivíduo, será representado no espaço dos estímulos por um ponto o qual será denominado de Ponto Ideal, indicando assim a preferência máxima do indivíduo pelos estímulos. Neste espaço, pode-se obter agrupamentos de Pontos Ideais em regiões particulares e estes tem papel importante na predição de segmentos no mercado. Entende-se por Escalonamento Multidimensional técnica multivariada descritiva que permite analisar dados relativos a preferências e semelhanças. Por outro lado os Modelos de Preferência são processos que permitem analisar, através de experimentos, variáveis cujas respostas expressem preferências individuais. Outro objetivo do trabalho é divulgar a técnica através de sua aplicação a um conjunto de dados reais de preferênciaAbstract: Not informedMestradoMestre em Estatístic
Bivariate response regression models with copulas: Sensitivity and residual analysis
Neste trabalho são apresentados modelos de regressão com respostas bivariadas obtidos através de funções cópulas. O objetivo de utilizar estes modelos bivariados é modelar a correlação entre eventos e captar nos modelos de regressão a influência da associação entre as variáveis resposta na presença de censura nos dados. Os parâmetros dos modelos, são estimados por meio dos métodos de máxima verossimilhança e jackknife. Alguns métodos de análise de sensibilidade como influência global, local e local total de um indivíduo, são introduzidos e calculados considerando diferentes esquemas de perturbação. Uma análise de resíduos foi proposta para verificar a qualidade do ajuste dos modelos utilizados e também foi proposta novas medidas de resíduos para respostas bivariadas. Métodos de simulação de Monte Carlo foram conduzidos para estudar a distribuição empírica dos resíduos marginais e bivariados propostos. Finalmente, os resultados são aplicados à dois conjuntos de dados dsponíveis na literatura.In this work bivariate response regression models are presented with the use of copulas. The objective of this approach is to model the correlation between events and capture the influence of this correlation in the regression parameters. The models are used in the context of survival analysis and are ¯tted to two data sets available in the literature. Inferences are obtained using maximum likelihood and Jackknife methods. Sensitivity techniques such as local and global in°uence are proposed and calculated. A residual analysis is proposed to check the adequacy of the models and simulation methods are used to asses the empirical distribution of the marginal univariate and bivariate residual measures proposed
- …
