Portail HAL Insee
Not a member yet
1187 research outputs found
Sort by
Algorithme CURIOS et méthode de priorisation pour les enquêtes en face-à-face.: Application à l'enquête Patrimoine 2014
National audienceThis paper presents the CURIOS algorithm used for the prioritization of CAPI surveys led at the French National Institute for Statistics and Economic Studies (INSEE). It is based on the minimization of a linear combination of several factors related to the quality of the sample, using Monte Carlo techniques to achieve the optimum. We explain how this algorithm functions and then present some results obtained for the 2014 Household Wealth survey, which second wave was prioritized.Dans un contexte de dégradation des taux de collecte dans les enquêtes ménages , l'INSEE cherche à utiliser au mieux les ressources disponibles. Il s'agit, étant donnés les moyens alloués a une enquête , d'obtenir l'échantillon collecté contenant le plus d'information possible (et conduisant ex post a la variance la plus faible possible). Un point de départ est le concept de R-indicateur, développé d` es 2009 par Schouten, qui permet de construire dans des enquêtes par téléphone des échantillons de répondants représentatifs de la population. Les R-indicateurs ont été initialement développés pour permettre la priorisation d'efforts de relance dans des enquêtes dont la collecte s'effectue par téléphone. Contrairement a ce cadre, la collecte en face-à-face ne permet pas un réajustement réactif des efforts de collecte, principalement car les enquêteurs organisent sur plusieurs semaines la collecte des unités qui leurs sont affectées. La solution choisie est de réaliser l'enquête en deux vagues. L'échantillon de vague 2 est tiré en prenant en compte le portrait de la collecte réalisée en vague 1. Il est tiré avec l'objectif d'équilibrer la collecte (et de minimiser la dispersion des poids) à la fin de la vague 2, en supposant que les conditions de collecte restent identiques entre les deux vagues. Ce principe a été mis en place pour l' enquête Patrimoine 2014 en région Île-de-France
Dynamiques régionales et territoriales face aux chocs économiques
Depuis 2008 la crise économique a altéré les dynamiques régionales de déve-loppement qui étaient inscrites dans la durée, liant notamment la croissance économique à la croissance démographique. Les régions Languedoc-Roussillon, Nord-Pas-de-Calais et Rhône-Alpes, présentent une certaine diversité de situations qui l’illustre.Depuis la crise, ces trois régions connaissent des trajectoires différenciées selon qu’elles s’inscrivent dans un schéma d’économie présentielle tournée vers la demande locale des populations, ou bien dans un schéma d’économie productive orientée vers une demande extérieure
Comment l'école amplifie les inégalités sociales et migratoires ?: Éducation prioritaire
L'utilisation des R-indicateurs pour prioriser la collecte des enquête ménages: une application à l'enquête Patrimoine 2010
National audienceThe French National Institute for Statistics and Economic Studies (INSEE) produces lots of face to face surveys and may face logistical problems such as a loss of response rate. We need prioritization techniques to select the households that need to be investigated in order to reduce as far as possible the non-response bias. To fulfill this goal, we use R-indicators to analyse the representativeness of the sample during the survey. These R-indicators offer us a way to differentiate population in terms of representativeness in order to prioritize the collect of data. The purpose of this paper will be to apply these methods to the data which were collected for the 2010 Household Wealth survey and to evaluate their effects on the quality of estimation of the distribution of wealth in France.Pour réaliser ses enquêtes ménages , qui se font principalement en face-à-face, l'INSEE échantillonne les individus interrogés par un sondage à deux degrés. Chaque unité primaire est une zone d'action enquêteur (ZAE), affectée à un ou plusieurs enquêteurs. L'INSEE peut rencontrer des problèmes logistiques tels que l'absence d'un enquêteur ou la baisse des taux de réponses dans une ZAE en particulier. Il est alors possible de réattribuer d'autres enquêteurs a la ZAE affectée , mais uniquement pour y réaliser un nombre restreint d' enquêtes. Nous avons donc besoin de techniques pour choisir les ménages a interroger en priorité, afin de réduire autant que possible le biais de non-réponse et la perte de précision induite par la baisse du taux de réponse. Pour ce faire il est possible de s'appuyer sur le concept de R-indicateur, ou indicateur de Représentativité, introduit par Schouten & al. en 2009. Le R-indicateur permet de mesurer, sans utiliser la variable d' intérêt ou des covariables, le degré de similarité d'un échantillon par rapport a la population de base. Il est basé sur la dispersion des probabilités des ménages échantillonnés a répondre , et, suivant Schouten et Shlomo (2011), se décline en R-indicateurs partiels permettant d'étudier cette représentativité variable par variable. Ces R-indicateurs sont des outils permettant d'analyser la collecte en isolant des groupes de populations sous-représentées ; de façon analogue à Slomo et Schouten (2013), on cible les populations ayant les R-indicateurs les plus grands. Cela permet de lancer une procédure dite de priorisation qui consiste à intensifier les efforts de collecte sur les groupes précédemment identifiés
Adaptive Multinomial Matrix Completion
The task of estimating a matrix given a sample of observed entries is known as the \emph{matrix completion problem}. Most works on matrix completion have focused on recovering an unknown real-valued low-rank matrix from a random sample of its entries. Here, we investigate the case of highly quantized observations when the measurements can take only a small number of values. These quantized outputs are generated according to a probability distribution parametrized by the unknown matrix of interest. This model corresponds, for example, to ratings in recommender systems or labels in multi-class classification. We consider a general, non-uniform, sampling scheme and give theoretical guarantees on the performance of a constrained, nuclear norm penalized maximum likelihood estimator. One important advantage of this estimator is that it does not require knowledge of the rank or an upper bound on the nuclear norm of the unknown matrix and, thus, it is adaptive. We provide lower bounds showing that our estimator is minimax optimal. An efficient algorithm based on lifted coordinate gradient descent is proposed to compute the estimator. A limited Monte-Carlo experiment, using both simulated and real data is provided to support our claims
Sparse high-dimensional varying coefficient model: non-asymptotic minimax study
oai:HAL:hal-00919503v2The objective of the present paper is to develop a minimax theory for the varying coefficient model in a non-asymptotic setting. We consider a high-dimensional sparse varying coefficient model where only few of the covariates are present and only some of those covariates are time dependent. Our analysis allows the time dependent covariates to have different degrees of smoothness and to be spatially inhomogeneous. We develop the minimax lower bounds for the quadratic risk and construct an adaptive estimator which attains those lower bounds within a constant (if all time-dependent covariates are spatially homogeneous) or logarithmic factor of the number of observations
Les méthodes d'estimation de la précision pour les enquêtes ménages de l'Insee tirées dans Octopusse
Le système actuel d’échantillonnage des enquêtes ménages à l’Insee, baptisé Octopusse,s’articule autour de deux concepts majeurs : d’une part le principe de système de tirage à deuxdegrés des échantillons-maîtres classiques, et d’autre part le recensement rotatif de lapopulation qui permet l’apport d’ « informations fraîches » concernant les logements àéchantillonner. Cette interaction entre ces deux concepts conduit à un processusd’échantillonnage efficace mais singulièrement complexe, qui rend particulièrement ardus lescalculs de précision portant sur des statistiques issues d’enquêtes tirées dans Octopusse. Cedocument de travail représente l’aboutissement de plusieurs années de travail sur le sujet.La première partie, intitulée « Compendium », revient sur le cadre méthodologique dusystème Octopusse et présente une synthèse du reste du document de travail. Les partiessuivantes exposent beaucoup plus en détails les simulations et études effectuées, lesdifférentes formules de variance et leur justification, ainsi que les résultats obtenus lors d’unepremière application de cette méthode d’estimation de variance dans le cadre de l’enquêteAES 2012
Effet des aides publiques sur l’emploi en R&D dans les petites entreprises
Entre 2003 et 2010 le montant des aides publiques servant à financer la recherche et développement (R&D) des petites et moyennes entreprises a augmenté de plus de 300 % : en 2010, il s'élève à près de 2 milliards d'euros dont 26 %, soit près de 500 millions d'euros, ont été perçus par les très petites entreprises (TPE). Cette très forte hausse est due notamment aux réformes du crédit d'impôt recherche et à la mise en place d'un dispositif dédié aux jeunes entreprises innovantes. Une analyse agrégée montre que la part de l'emploi consacré à la R&D financé par des aides à la R&D a été multipliée par quatre pour les TPE, passant de 14 % en 2003 à 49 % en 2010. Cette évolution a été accompagnée d'une baisse du nombre d'emplois consacrés à la R&D financés en propre par les TPE (et les PME dans une moindre mesure). L'utilisation de méthodes économétriques sur un panel de petites entreprises des secteurs les plus intenses en R&D tend à confirmer cette analyse : les aides à la R&D semblent avoir un impact positif sur l'emploi hautement qualifié et en R&D mais l'impact sur les dépenses de personnel serait nettement inférieur à l'augmentation des aides reçues, notamment à partir de 2008
Précision de l'enquête Patrimoine 2010
Ce document de travail présente les résultats en termes de précision pour les principaux indicateurs calculés sur l'enquête Patrimoine 2010. Cette enquête a bénéficié d'un certain nombre d'innovations méthodologiques qui ont permis de mieux capter la forte concentration du patrimoine dans le haut de la distribution. Ce travail offre une évaluation de ces innovations en termes de gain de précision et analyse les écarts observés entre 2004 et 2010. Par ailleurs, la précision de l'enquête a été calculée de manière analytique, par une décomposition des sources d'imprécision due aux différents degrés de sondage. Un calcul par poids répliqués a également été réalisé, ce qui permet de mettre à disposition des utilisateurs de l'enquête l'information liée à la précision des estimateurs. Ce calcul est validé empiriquement en comparant les résultats obtenus par le calcul analytique et ceux donnés par les poids répliqués. Enfin, l'information contenue dans les poids répliqués est combinée avec les imputations multiples réalisées dans le cadre de la production de l'enquête afin d'obtenir une estimation de l'incertitude globale
Rencontrer son conjoint dans un espace multiculturel et international
International audienc