Portail HAL Insee
Not a member yet
1187 research outputs found
Sort by
Les configurations de points
International audienceStatisticians carry out close examination of spatialized data, such as the distribution of household income, the location of industrial or commercial establishments, the distribution of schools in cities, etc. Answers can be found through analyses of one or more predefined geographical scales such as neighbourhoods, districts or statistical blocks. However, it is tempting to preserve the individual data and to work with the exact position of the entities that are being studied. If that is the case, statisticians have to conduct analyses based on geolocation data without carrying out any geographical aggregation. Observations are taken as points in space and the objective is to characterise these point distributions. Understanding and mastering statistical methods that process this individual and spatialized information enables us to work on data that are now increasingly accessible and sought after because they provide very precise analyses of distributions studied (Ellison et al. 2010; Barlet et al. 2013). In this framework of analysis, statisticians who have sets of points to analyse are faced with several important methodological questions: how can such data with thousands or even millions of observations be represented and characterised spatially? What statistical tools exist that can be used to study these observations relating to households, employees, firms, stores, equipment or travel, for example? How can the qualitative or quantitative characteristics of the observations being studied be taken into account? How can any attractions or repulsions between points or between different types of points be highlighted? How can we assess the significance of the results obtained, etc? The purpose of this chapter is to help statisticians to provide statistically robust results from the study of spatialized data that is not based on predefined zoning. To do this, we will review the literature on the subject of statistical methods used to characterise point distributions and we will explain the associated issues. We will use simple examples to explain the advantages and disadvantages of the most frequently adopted approaches. The code provided in R will be used to reproduce the examples covered.Les statisticiens examinent de près des données spatialisées, telles que la répartition des revenus des ménages, la localisation des établissements industriels ou commerciaux, la répartition des écoles dans les villes, etc. Les analyses à une ou plusieurs échelles géographiques prédéfinies, telles que les quartiers, les districts ou les îlots statistiques, permettent de trouver des réponses. Cependant, il est tentant de conserver les données individuelles et de travailler avec la position exacte des entités étudiées. Dans ce cas, les statisticiens doivent effectuer des analyses basées sur des données de géolocalisation sans procéder à une quelconque agrégation géographique. Les observations sont prises comme des points dans l'espace et l'objectif est de caractériser ces distributions ponctuelles. La compréhension et la maîtrise des méthodes statistiques qui traitent ces informations individuelles et spatialisées permettent de travailler sur des données qui sont aujourd'hui de plus en plus accessibles et recherchées car elles fournissent des analyses très précises des distributions étudiées (Ellison et al. 2010 ; Barlet et al. 2013). Dans ce cadre d'analyse, les statisticiens qui ont des ensembles de points à analyser sont confrontés à plusieurs questions méthodologiques importantes : comment représenter et caractériser spatialement de telles données comportant des milliers, voire des millions d'observations ? Quels sont les outils statistiques permettant d'étudier ces observations relatives aux ménages, aux salariés, aux entreprises, aux magasins, aux équipements ou aux déplacements, par exemple ? Comment prendre en compte les caractéristiques qualitatives ou quantitatives des observations étudiées ? Comment mettre en évidence des attractions ou des répulsions entre des points ou entre différents types de points ? Comment évaluer la signification des résultats obtenus, etc. L'objectif de ce chapitre est d'aider les statisticiens à fournir des résultats statistiquement robustes à partir de l'étude de données spatialisées qui ne sont pas basées sur un zonage prédéfini. Pour ce faire, nous ferons une revue de la littérature sur le sujet des méthodes statistiques utilisées pour caractériser les distributions ponctuelles et nous expliquerons les enjeux associés. A l'aide d'exemples simples, nous expliquerons les avantages et les inconvénients des approches les plus fréquemment adoptées. Le code fourni en R sera utilisé pour reproduire les exemples traités
Wage floor rigidity in industry-level agreements: Evidence from France
This paper examines empirically the dynamics of wage floors defined in industry-level wage agreements in France. It also investigates how industry-level wage floor adjustment interacts with changes in the national minimum wage (NMW hereafter). For this, we have collected a unique dataset of approximately 3200 industry-level wage agreements containing about 70,000 occupation-specific wage floors in 367 industries over the period 2006Q1-2017Q4. Our main results are the following. Wage floors are quite rigid, adjusting only once a year on average. They mostly adjust in the first quarter of the year and the NMW shapes the timing of industry-level wage bargaining. Inflation but also changes in past aggregate wage increases and in the real NMW are the main drivers of wage floor adjustments. Elasticities of wage floors with respect to these macro variables are 0.6, 0.4 and 0.3 respectively. Inflation and the NMW have both decreasing but positive effects all along the wage floor distribution
Nowcasting GDP Growth by Reading Newspapers
International audienceGDP statistics in France are published on a quarterly basis, 30 days after the end of the quarter. In this article, we consider media content as an additional data source to traditional economic tools to improve short-term forecast/nowcast of French GDP. We use a database of more than a million articles published in the newspaper Le Monde between 1990 and 2017 to create a new synthetic indicator capturing media sentiment about the state of the economy. We compare an autoregressive model augmented by the media sentiment indicator with a simple autoregressive model. We also consider an autoregressive model augmented with the Insee Business Climate indicator. Adding a media indicator improves French GDP forecasts compared to these two reference models. We also test an automated approach using penalised regression, where we use the frequencies at which words or expressions appear in the articles as regressors, rather than aggregated information. Although this approach is easier to implement than the former, its results are less accurate
Forecasting French GDP with Dynamic Factor Models : a pseudo-real time experiment using Factor-augmented Error Correction Models
Dynamic Factor Models (DFMs) allow to take advantage of the information provided by a large dataset, which is summarized by a small set of unobservable latent variables, and they have proved to be very useful for short-term forecasting. Since most of their properties rely on the stationarity of the series, these models have been mainly used on data which have been di_erenciated to achieve stationarity. However estimation procedures for DFMs with I(1) common factors have been proposed by Bai (2004) and Bai and Ng(2004). Further, Banerjee and Marcellino (2008) and Banerjee, Marcellino and Masten (2014) have proposed to extend stationary Factor Augmented VAR models to the non-stationary case, and introduced Factor augmented Error Correction Models (FECM). We rely on this approach and conduct a pseudoreal time forecasting experiment, in which we compare short term forecasts of French GDP based on stationary and non-stationary DFMs. We mimic the timeliness of data, and use in the non-stationary framework the 2-step estimator proposed by Doz, Giannone and Reichlin(2011). In our study, forecasts based on stationary or non-stationary DFMs have a similar precision
Bien comprendre la déclaration sociale nominative pour mieux mesurer
International audienceL'Insee établit des statistiques sur l'emploi et les salaires depuis plus d'un demi siècle à partir de différentes déclarations administratives. La mise en place de la déclaration sociale nominative n'a pas simplement consisté à fusionner les déclarations administratives existantes. Elle a également conduit à rationaliser et simplifier les données d'une part, et à définir rigoureusement le cadre dans lequel s'effectuent les échanges d'informations entre les entreprises et les organismes destinataires de la DSN, d'autre part. Elle a obligé l'institut à mener une refonte de grande ampleur de son système d'information en même temps qu'elle est venue questionner l'organisation des travaux. Les contrôles réalisés en amont, à l'occasion de la collecte des données, assurent en contrepartie de recevoir les déclarations avec un certain degré de qualité et donc avec une certaine valeur ajoutée. Pour tirer le meilleur parti de la DSN, le statisticien doit mieux connaître l'étape de collecte et de contrôle et s'impliquer davantage dans les nouvelles instances de gouvernance de la DSN. Même si la priorité à court terme a été d'intégrer la DSN dans son système d'information, la prochaine étape va consister pour l'Insee à construire un système suffisamment souple et modulaire qui permettra d'exploiter toutes les potentialités de cette nouvelle source d'information
Les données de téléphonie mobile peuvent-elles améliorer la mesure du tourisme international en France ?
International audienceSince July 2015, the Banque de France and the French Ministry for the Economy andFinance have been experimenting with the use of mobile phone data to estimate the number and overnight stays of foreign visitors in France. The purpose of the experiment is to assess the ability of such data to eventually replace, in part or in whole, the traffic data by mode of transport currently used to establish the representativeness of foreign visitor surveys (Enquête auprès des visiteurs venant de l’étranger or EVE). Mobile phone data have yet to be incorporated into the method used to count tourists. However, estimates based on mobile phone data have a number of benefits in terms of the time required to obtain data, the level of temporal and geographical detail and short-term trend monitoring. This ongoing trial illustrates the difficulty of exploiting original Big Data and demonstrates the importance of drawing on traditional survey data to improve the quality of estimates.Depuis juillet 2015, la Banque de France et le ministère de l’Économie et des Financesexpérimentent l’utilisation de données de téléphonie mobile pour l’estimation du nombre et des nuitées des visiteurs étrangers en France. Cette expérience est destinée à évaluer la capacité de ces données à remplacer à terme, en tout ou partie, les données de trafic par mode de transport actuellement utilisées pour asseoir la représentativité de l’Enquête auprès des visiteurs venant de l’étranger (EVE). À ce jour, les données de téléphonie mobile ne sont pas intégrées en production dans le dispositif de dénombrement des visiteurs. Les estimations issues des données de téléphonie mobile présentent toutefois plusieurs intérêts en termes de délai d’obtention, de détail temporel et géographique et de suivi conjoncturel. L’expérience, encore en cours, illustre les difficultés d’exploitation de données originales de type Big Data et démontre la nécessité de l’usagecomplémentaire de données d’enquêtes classiques pour améliorer la qualité des estimations
Modèles semi-paramétriques de survie en temps continu sous R
Ce document se veut une introduction pratique à la mise en œuvre sous R des modèles desurvie en temps continu dans la cadre semi-paramétrique, souvent appelé modèle de Cox. Aprèsavoir explicité la spécificité des modèles de survie, nous présentons comment mettre en œuvrele modèle à hasards proportionnels (et notamment comment questionner sa validité). Enfin, unchapitre est aussi consacré à la prise en compte de l’hétérogénéité individuelle inobservée
Contraintes financières des entreprises innovantes et croissance sectorielle
Innovation policies can consist in measures aimed at directly alleviating financial constraints of innovative firms, beyond more traditional fiscal incentives to foster private R&D spendings. To explore the interaction between innovation and financial constraints at the sector level, and evaluate stylized policy scenarios, this paper brings together two analytical frameworks from the endogenous growth and corporate finance literatures. Within this dynamic model, firms innovate and compete for products through destructive creation and accumulate internal funds in relation to financial hindrances occurring when they enter, develop or exit. Including notably asymmetric information between investors and managers of firms with respect to uncertain cash flows, this model is first consistent with the fact that firms tend to spend more on R&D when their internal funds are higher. It then allows for experiments addressing growth and overall liquidity holdings for various sectoral contexts. In this specific framework, easing access to initial funding, as fiscal incentives, can have substantial effects. Moreover, while a stylized high-tech sector is associated with higher growth and overall liquidity holdings, both variables depend to a large extent on many sectoral characteristics, such as R&D efficiency, entry costs, and cash flow mean and volatility.Les politiques d’innovation peuvent consister en des mesures visant à soulager directementles contraintes financières des entreprises innovantes, au-delà des incitations fiscales plususuelles pour stimuler la dépense privée de R&D. Pour explorer les interactions entreinnovation et contraintes financières au niveau sectoriel, et évaluer des variantes politiquesstylisées, cette étude rassemble deux cadres analytiques issus des littératures en matière decroissance endogène et de finance d'entreprise. Au sein de ce modèle dynamique, les entre-prises innovent et se concurrencent en termes de produits selon un principe de créationdestructrice, et accumulent des fonds internes en rapport avec des obstacles financierssurvenant lorsqu’elles sont créées, se développent ou disparaissent. En présence notam-ment d’asymétries d’information entre investisseurs et dirigeants d’une entreprise concer-nant des bénéfices incertains, ce modèle vérifie d’abord le fait que les entreprises tendent àdépenser plus en R&D quand leurs fonds internes sont plus élevés. Il se prête ensuite à desvariantes pour analyser la croissance et la détention globale de liquidités dans différentscontextes sectoriels. Dans ce cadre spécifique, faciliter la levée initiale de fonds internes,comme les incitations fiscales, peut avoir des effets notables. En outre, alors qu’un secteurhigh-tech stylisé est associé à une croissance et une détention globale de liquidités plusélevées, ces deux grandeurs dépendent largement de diverses caractéristiques sectorielles,comme l'efficactié de la recherche, les coûts d’entrée, le montant moyen des bénéfices, ouencore l'incertitude sur ces derniers
Inégalités de consommation en France entre 1995 et 2011
How did consumption inequalities evolve in France over the last two decades, and notablycompared to disposable income? For the United States in particular, while earliest long runmeasures of consumption inequalities displayed stability, this pattern has been challengedby a refined indicator mitigating under-reporting and depicting an increase of the same orderof magnitude as for disposable income (Aguiar and Bils, 2015). Relying on the surveyBudget de famille between 1995 and 2011, this work first develops standard inequalitymeasures for France and derives them with respect to consumption categories, ages andhousehold compositions. Under a standard sample and consumption bundle, consumptioninequality did not track income inequality in France especially during the crisis. Byconsumption category, the level of consumption inequality is lower and increased for inferiorgoods. Second, to correct potential systematic under-reporting errors, an alternative indicatorsimilar to Aguiar and Bils (2015) is built relying on differences in luxuries and necessitiesexpenditures between high- and low-income households. Yet, there seems to be no problemdue to mis-measurement related to specific income groups over the whole time period inFrance. Relatedly, the alternative indicator of consumption inequality depicts no risingpattern, such as the one observed for the United States due to large relative underreportingby high-income respondents. Thus, both the standard and alternative inequality indicators donot illustrate consumption inequalities rising as income inequalities. As the latter did notincrease to a large extent, this slight difference does not reflect an alarming surge inhousehold indebtedness such as for the US over the same period.Comment ont évolué les inégalités de consommation en France durant les deux dernières décennies, et notamment en comparaison des inégalités de revenu ? Pour les États-Unis, alors que les premières mesures de ces inégalités faisaient apparaître une stabilité dans le temps, cette tendance a été remise en question par un indicateur alternatif contrôlant des sous-déclarations des dépenses de consommation et témoignant plutôt d'une hausse du même ordre que celle observée pour les inégalités de revenus (Aguiar et Bils, 2015). Cette étude développe dans un premier temps des indicateurs usuels pour la France, à partir de l'enquête Budget de famille entre 1995 et 2011, et les décline selon différents postes de consommation et pour différentes classes d'âge ou compositions de ménage. En prenant un échantillon de ménages et un panier de consommation standards, les inégalités de consommation ne semblent pas avoir accompagné en France la hausse des inégalités de revenu, en particulier durant la crise. Pour les biens inférieurs toutefois, le niveau des inégalités de consommation, certes moins élevé, a augmenté. Dans un second temps, pour corriger de potentiels biais de sous-déclaration, un indicateur alternatif est construit, analogue à celui d'Aguiar et Bils ( 2015) sur les États-Unis et reposant sur les différences de dépenses en biens de luxe et de première nécessité entre les ménages des bas et hauts revenus. Toutefois, alors que de larges sous-déclarations de la part des ménages de hauts revenus sont observées aux États-Unis, il ne semble pas y avoir d'incidence de tels problèmes de mesure en France. Ainsi, dans l'ensemble, qu'elles soient mesurées à partir d'indicateurs usuels ou de l'indicateur alternatif, les inégalités de consommation n'ont pas crû comme les inégalités de revenu. Ces dernières n'ayant pas elles-mêmes crû fortement, cette légère divergence ne signale pas de recours préoccupant à l'endettement sur cette période comme il a pu en être pour les États-Unis
Prime à l'embauche dans les PME : évaluation à partir des déclarations d'embauche
The French hiring subsidy program for SMEs was implemented in January 2016 and financed the creation of new long-term contracts for workers earning less than 1.3 times the hourly minimum wage. This study is aims at evaluating this measure. It has been conducted using the pre-hiring declarations filled by French employers. The subsidies granted in 2016 amounted to 2.6 billion euros and financed 965 000 hires. About 55 % of the hires that qualified for the program actually benefited from a subsidy. Descriptive statistics suggest that the growth in hires in fixed-term contracts lasting at least 6 months was more pronounced for firms with less than 250 workers (treated firms). In order to see if this is a causal effect of the program, the discontinuity in the eligibility to the program at the 250 workers threshold is leveraged in difference-in-difference estimations. Results suggest that the program increased hires in permanent contracts. The impact on employment appears to be limited by substitution effects between permanent contracts and fixed-term contracts lasting less than 6 months. In an alternative identification setting, the effect of the program on firms with less than 50 workers is isolated using the heterogeneity of exposure to the measure across labor markets. The program seems to have increased hires in fixed-term contracts lasting at least 6 months, the effects being concentrated on firms having between 10 and 49 workers.La prime à l’embauche dans les petites et moyennes entreprises (PME) mise en place enjanvier 2016 subventionne la création d’emplois stables (CDI ou CDD d’au moins 6 mois)pour des travailleurs rémunérés jusqu’à 1,3 Smic. Cette étude fournit une évaluation de cedispositif à partir des déclarations préalables à l’embauche des employeurs. Les primesaccordées en 2016 portent sur 965 000 embauches pour un montant total (alloué etprévisionnel) de 2,6 milliards d'euros. On peut estimer qu'environ 55 % des embaucheséligibles au dispositif ont bénéficié de la prime. Les statistiques descriptives montrent unecroissance plus marquée des embauches en CDD de 6 mois ou plus dans les PME, éligiblesà la prime, que dans les entreprises plus grandes, non-éligibles. Afin de vérifier si cedifférentiel reflète un effet de la prime, on compare les différences d’embauches entre PMEet entreprises de plus de 250 salariés avant et après la mise en place de la prime, dans lecadre d’estimations en différence-de-différence. Les résultats suggèrent que la prime apermis une augmentation des embauches en CDI. L’effet sur l’emploi est limité par desphénomènes de substitution entre CDD courts et CDI. Dans une stratégie d’identificationalternative, l’effet de la prime sur les entreprises de moins de 50 salariés est isolé en utilisant l’hétérogénéité d’exposition au dispositif. La prime semble avoir permis d’augmenter lesembauches en CDD de 6 mois ou plus, les effets étant concentrés sur les entreprises de 10à 49 salariés