400 research outputs found

    Nouveau modèle de documents pour une bibliothèque numérique de thèses accessibles par leur contenu sémantique

    No full text
    The variety of existing initiatives in favor of the diffusion of the theses on Internet shows the interest of this need within the academic world. The current projects of digital libraries offer the user an access to the digital theses by searching within the title of the thesis, the name of the author, the name of the tutor, and the date of the defense of the thesis. On the other hand, this type of research does not make possible to extract the relevant parts of the thesis and it only returns the integral thesis. Thus, the user must have to read the whole chapters to know which parts of the thesis correspond to his needs. The project named CITHER of the INSA of Lyon (Consultation en texte Intégral des THèses En Réseau), in which is registered this study, relates to the setting of the theses online. CITHER, in a first phase, has set up a diffusion of the theses, via a server, in the form of complete text, in PDF (Portable Document Format). So, by making a research is possible to reach the contents of only one thesis at the same time, by the means of each chapter. This way, there is the need to carry out a research for information in a more precise and more selective way in order to offer to the user the most relevant information exists. The objective of our research is to improve the diffusion of the theses. For that, we propose to give access to its contents in a precise way thanks to the use of « semantic markups » added into the thesis, by the PhD student, during the writing step. The exploitation of these markups makes possible to refine the contents of research to better satisfy the user. Our work concerns the definition of a new model of document by studying the different structures of the thesis (logic structure and semantic structure). Our approach is based on the semantic modeling of the theses of the INSA of Lyon. In the same way, we had set up functionalities to ameliorate the research and the access to the documentary contents, adapted to our case of study, i. E. The scientific theses. Finally, we had set up qualitative and quantitative procedures of experimental evaluations, allowing an analysis of the performance of the results of iterative research of our prototype in order to compare them with the current system of CITHER. This research represents an important contribution for the search for relevant information in the theses, by providing to the PhD student a tool to easily organize his thesis in an adapted way. Our results have made possible to validate the importance to define the semantic structure at the time of the creation of documents in order to better access the information containedLa diversité des initiatives existantes en faveur de la diffusion des thèses sur Internet témoigne de l'intérêt pour ce besoin au sein des milieux universitaires. Les projets de bibliothèques numériques actuels offrent à l'utilisateur l'accès aux thèses à partir d'une recherche en utilisant le titre de la thèse, les noms de l'auteur, le nom du directeur de la thèse, et la date de soutenance. Ce type de recherche ne permet pas d'extraire les parties pertinentes de la thèse et ne renvoie que la thèse intégrale. Ainsi l'utilisateur doit lire des chapitres entiers pour connaître les parties qui correspondent à son besoin. Le projet CITHER de l'INSA de Lyon (Consultation en texte Intégral des THèses En Réseau) dans lequel s'inscrit cette étude, porte sur la mise en ligne des thèses. CITHER, dans une première phase, a mis en place une diffusion des thèses, via un serveur, sous forme de texte intégral, en format PDF (Portable Document Format). De ce fait, lors d'une recherche il est possible d'accéder au contenu d'une seule thèse à la fois, par le biais de chaque chapitre. Pourtant il existe le besoin d'effectuer une recherche d'information de manière plus précise, plus sélective et d'offrir à l'utilisateur l'information la plus pertinente. L'objet du travail de recherche vise à améliorer la diffusion des thèses. Pour cela, nous proposons de permettre l'accès à son contenu de façon précise grâce à l'utilisation de " tags sémantiques " rajoutés, par le doctorant, au sein de la thèse lors de sa rédaction. L'exploitation de ces tags permet d'affiner la recherche et ainsi mieux satisfaire l'utilisateur. Notre travail porte sur la définition d'un nouveau modèle de document en nous appuyant sur l'étude des différentes structures de la thèse (structure logique et structure sémantique). Notre approche est fondée sur la modélisation sémantique des thèses de l'INSA de Lyon. Nous avons aussi, été amenés à mettre en place des fonctionnalités d'aide à la recherche et à l'accès aux contenus documentaires, adaptées à notre cas d'étude, c'est à dire les thèses scientifiques. Enfin, nous avons mis en place des procédures d'évaluations expérimentales qualitatives et quantitatives, permettant une analyse de performance des résultats des recherches itératives de notre prototype et de les comparer avec le système actuel de CITHER. Cette recherche représente un apport intéressant pour la recherche d'information pertinente dans les thèses, en fournissant au doctorant les moyens de construire facilement sa thèse de manière adaptée. Nos résultats ont permis de valider l'importance de définir la structure sémantique lors de la création de documents afin de mieux exploiter l'information contenu

    Nouveau modèle de documents pour une bibliothèque numérique de thèses accessibles par leur contenu sémantique

    No full text
    The variety of existing initiatives in favor of the diffusion of the theses on Internet shows the interest of this need within the academic world. The current projects of digital libraries offer the user an access to the digital theses by searching within the title of the thesis, the name of the author, the name of the tutor, and the date of the defense of the thesis. On the other hand, this type of research does not make possible to extract the relevant parts of the thesis and it only returns the integral thesis. Thus, the user must have to read the whole chapters to know which parts of the thesis correspond to his needs. The project named CITHER of the INSA of Lyon (Consultation en texte Intégral des THèses En Réseau), in which is registered this study, relates to the setting of the theses online. CITHER, in a first phase, has set up a diffusion of the theses, via a server, in the form of complete text, in PDF (Portable Document Format). So, by making a research is possible to reach the contents of only one thesis at the same time, by the means of each chapter. This way, there is the need to carry out a research for information in a more precise and more selective way in order to offer to the user the most relevant information exists. The objective of our research is to improve the diffusion of the theses. For that, we propose to give access to its contents in a precise way thanks to the use of « semantic markups » added into the thesis, by the PhD student, during the writing step. The exploitation of these markups makes possible to refine the contents of research to better satisfy the user. Our work concerns the definition of a new model of document by studying the different structures of the thesis (logic structure and semantic structure). Our approach is based on the semantic modeling of the theses of the INSA of Lyon. In the same way, we had set up functionalities to ameliorate the research and the access to the documentary contents, adapted to our case of study, i. E. The scientific theses. Finally, we had set up qualitative and quantitative procedures of experimental evaluations, allowing an analysis of the performance of the results of iterative research of our prototype in order to compare them with the current system of CITHER. This research represents an important contribution for the search for relevant information in the theses, by providing to the PhD student a tool to easily organize his thesis in an adapted way. Our results have made possible to validate the importance to define the semantic structure at the time of the creation of documents in order to better access the information containedLa diversité des initiatives existantes en faveur de la diffusion des thèses sur Internet témoigne de l'intérêt pour ce besoin au sein des milieux universitaires. Les projets de bibliothèques numériques actuels offrent à l'utilisateur l'accès aux thèses à partir d'une recherche en utilisant le titre de la thèse, les noms de l'auteur, le nom du directeur de la thèse, et la date de soutenance. Ce type de recherche ne permet pas d'extraire les parties pertinentes de la thèse et ne renvoie que la thèse intégrale. Ainsi l'utilisateur doit lire des chapitres entiers pour connaître les parties qui correspondent à son besoin. Le projet CITHER de l'INSA de Lyon (Consultation en texte Intégral des THèses En Réseau) dans lequel s'inscrit cette étude, porte sur la mise en ligne des thèses. CITHER, dans une première phase, a mis en place une diffusion des thèses, via un serveur, sous forme de texte intégral, en format PDF (Portable Document Format). De ce fait, lors d'une recherche il est possible d'accéder au contenu d'une seule thèse à la fois, par le biais de chaque chapitre. Pourtant il existe le besoin d'effectuer une recherche d'information de manière plus précise, plus sélective et d'offrir à l'utilisateur l'information la plus pertinente. L'objet du travail de recherche vise à améliorer la diffusion des thèses. Pour cela, nous proposons de permettre l'accès à son contenu de façon précise grâce à l'utilisation de " tags sémantiques " rajoutés, par le doctorant, au sein de la thèse lors de sa rédaction. L'exploitation de ces tags permet d'affiner la recherche et ainsi mieux satisfaire l'utilisateur. Notre travail porte sur la définition d'un nouveau modèle de document en nous appuyant sur l'étude des différentes structures de la thèse (structure logique et structure sémantique). Notre approche est fondée sur la modélisation sémantique des thèses de l'INSA de Lyon. Nous avons aussi, été amenés à mettre en place des fonctionnalités d'aide à la recherche et à l'accès aux contenus documentaires, adaptées à notre cas d'étude, c'est à dire les thèses scientifiques. Enfin, nous avons mis en place des procédures d'évaluations expérimentales qualitatives et quantitatives, permettant une analyse de performance des résultats des recherches itératives de notre prototype et de les comparer avec le système actuel de CITHER. Cette recherche représente un apport intéressant pour la recherche d'information pertinente dans les thèses, en fournissant au doctorant les moyens de construire facilement sa thèse de manière adaptée. Nos résultats ont permis de valider l'importance de définir la structure sémantique lors de la création de documents afin de mieux exploiter l'information contenu

    Nouveau modèle de documents pour une bibliothèque numérique de thèses accessibles par leur contenu sémantique

    No full text
    The variety of existing initiatives in favor of the diffusion of the theses on Internet shows the interest of this need within the academic world. The current projects of digital libraries offer the user an access to the digital theses by searching within the title of the thesis, the name of the author, the name of the tutor, and the date of the defense of the thesis. On the other hand, this type of research does not make possible to extract the relevant parts of the thesis and it only returns the integral thesis. Thus, the user must have to read the whole chapters to know which parts of the thesis correspond to his needs. The project named CITHER of the INSA of Lyon (Consultation en texte Intégral des THèses En Réseau), in which is registered this study, relates to the setting of the theses online. CITHER, in a first phase, has set up a diffusion of the theses, via a server, in the form of complete text, in PDF (Portable Document Format). So, by making a research is possible to reach the contents of only one thesis at the same time, by the means of each chapter. This way, there is the need to carry out a research for information in a more precise and more selective way in order to offer to the user the most relevant information exists. The objective of our research is to improve the diffusion of the theses. For that, we propose to give access to its contents in a precise way thanks to the use of « semantic markups » added into the thesis, by the PhD student, during the writing step. The exploitation of these markups makes possible to refine the contents of research to better satisfy the user. Our work concerns the definition of a new model of document by studying the different structures of the thesis (logic structure and semantic structure). Our approach is based on the semantic modeling of the theses of the INSA of Lyon. In the same way, we had set up functionalities to ameliorate the research and the access to the documentary contents, adapted to our case of study, i. E. The scientific theses. Finally, we had set up qualitative and quantitative procedures of experimental evaluations, allowing an analysis of the performance of the results of iterative research of our prototype in order to compare them with the current system of CITHER. This research represents an important contribution for the search for relevant information in the theses, by providing to the PhD student a tool to easily organize his thesis in an adapted way. Our results have made possible to validate the importance to define the semantic structure at the time of the creation of documents in order to better access the information containedLa diversité des initiatives existantes en faveur de la diffusion des thèses sur Internet témoigne de l'intérêt pour ce besoin au sein des milieux universitaires. Les projets de bibliothèques numériques actuels offrent à l'utilisateur l'accès aux thèses à partir d'une recherche en utilisant le titre de la thèse, les noms de l'auteur, le nom du directeur de la thèse, et la date de soutenance. Ce type de recherche ne permet pas d'extraire les parties pertinentes de la thèse et ne renvoie que la thèse intégrale. Ainsi l'utilisateur doit lire des chapitres entiers pour connaître les parties qui correspondent à son besoin. Le projet CITHER de l'INSA de Lyon (Consultation en texte Intégral des THèses En Réseau) dans lequel s'inscrit cette étude, porte sur la mise en ligne des thèses. CITHER, dans une première phase, a mis en place une diffusion des thèses, via un serveur, sous forme de texte intégral, en format PDF (Portable Document Format). De ce fait, lors d'une recherche il est possible d'accéder au contenu d'une seule thèse à la fois, par le biais de chaque chapitre. Pourtant il existe le besoin d'effectuer une recherche d'information de manière plus précise, plus sélective et d'offrir à l'utilisateur l'information la plus pertinente. L'objet du travail de recherche vise à améliorer la diffusion des thèses. Pour cela, nous proposons de permettre l'accès à son contenu de façon précise grâce à l'utilisation de " tags sémantiques " rajoutés, par le doctorant, au sein de la thèse lors de sa rédaction. L'exploitation de ces tags permet d'affiner la recherche et ainsi mieux satisfaire l'utilisateur. Notre travail porte sur la définition d'un nouveau modèle de document en nous appuyant sur l'étude des différentes structures de la thèse (structure logique et structure sémantique). Notre approche est fondée sur la modélisation sémantique des thèses de l'INSA de Lyon. Nous avons aussi, été amenés à mettre en place des fonctionnalités d'aide à la recherche et à l'accès aux contenus documentaires, adaptées à notre cas d'étude, c'est à dire les thèses scientifiques. Enfin, nous avons mis en place des procédures d'évaluations expérimentales qualitatives et quantitatives, permettant une analyse de performance des résultats des recherches itératives de notre prototype et de les comparer avec le système actuel de CITHER. Cette recherche représente un apport intéressant pour la recherche d'information pertinente dans les thèses, en fournissant au doctorant les moyens de construire facilement sa thèse de manière adaptée. Nos résultats ont permis de valider l'importance de définir la structure sémantique lors de la création de documents afin de mieux exploiter l'information contenu

    Nouveau modèle de documents pour une bibliothèque numérique de thèses accessibles par leur contenu sémantique

    No full text
    The variety of existing initiatives in favor of the diffusion of the theses on Internet shows the interest of this need within the academic world. The current projects of digital libraries offer the user an access to the digital theses by searching within the title of the thesis, the name of the author, the name of the tutor, and the date of the defense of the thesis. On the other hand, this type of research does not make possible to extract the relevant parts of the thesis and it only returns the integral thesis. Thus, the user must have to read the whole chapters to know which parts of the thesis correspond to his needs. The project named CITHER of the INSA of Lyon (Consultation en texte Intégral des THèses En Réseau), in which is registered this study, relates to the setting of the theses online. CITHER, in a first phase, has set up a diffusion of the theses, via a server, in the form of complete text, in PDF (Portable Document Format). So, by making a research is possible to reach the contents of only one thesis at the same time, by the means of each chapter. This way, there is the need to carry out a research for information in a more precise and more selective way in order to offer to the user the most relevant information exists. The objective of our research is to improve the diffusion of the theses. For that, we propose to give access to its contents in a precise way thanks to the use of « semantic markups » added into the thesis, by the PhD student, during the writing step. The exploitation of these markups makes possible to refine the contents of research to better satisfy the user. Our work concerns the definition of a new model of document by studying the different structures of the thesis (logic structure and semantic structure). Our approach is based on the semantic modeling of the theses of the INSA of Lyon. In the same way, we had set up functionalities to ameliorate the research and the access to the documentary contents, adapted to our case of study, i. E. The scientific theses. Finally, we had set up qualitative and quantitative procedures of experimental evaluations, allowing an analysis of the performance of the results of iterative research of our prototype in order to compare them with the current system of CITHER. This research represents an important contribution for the search for relevant information in the theses, by providing to the PhD student a tool to easily organize his thesis in an adapted way. Our results have made possible to validate the importance to define the semantic structure at the time of the creation of documents in order to better access the information containedLa diversité des initiatives existantes en faveur de la diffusion des thèses sur Internet témoigne de l'intérêt pour ce besoin au sein des milieux universitaires. Les projets de bibliothèques numériques actuels offrent à l'utilisateur l'accès aux thèses à partir d'une recherche en utilisant le titre de la thèse, les noms de l'auteur, le nom du directeur de la thèse, et la date de soutenance. Ce type de recherche ne permet pas d'extraire les parties pertinentes de la thèse et ne renvoie que la thèse intégrale. Ainsi l'utilisateur doit lire des chapitres entiers pour connaître les parties qui correspondent à son besoin. Le projet CITHER de l'INSA de Lyon (Consultation en texte Intégral des THèses En Réseau) dans lequel s'inscrit cette étude, porte sur la mise en ligne des thèses. CITHER, dans une première phase, a mis en place une diffusion des thèses, via un serveur, sous forme de texte intégral, en format PDF (Portable Document Format). De ce fait, lors d'une recherche il est possible d'accéder au contenu d'une seule thèse à la fois, par le biais de chaque chapitre. Pourtant il existe le besoin d'effectuer une recherche d'information de manière plus précise, plus sélective et d'offrir à l'utilisateur l'information la plus pertinente. L'objet du travail de recherche vise à améliorer la diffusion des thèses. Pour cela, nous proposons de permettre l'accès à son contenu de façon précise grâce à l'utilisation de " tags sémantiques " rajoutés, par le doctorant, au sein de la thèse lors de sa rédaction. L'exploitation de ces tags permet d'affiner la recherche et ainsi mieux satisfaire l'utilisateur. Notre travail porte sur la définition d'un nouveau modèle de document en nous appuyant sur l'étude des différentes structures de la thèse (structure logique et structure sémantique). Notre approche est fondée sur la modélisation sémantique des thèses de l'INSA de Lyon. Nous avons aussi, été amenés à mettre en place des fonctionnalités d'aide à la recherche et à l'accès aux contenus documentaires, adaptées à notre cas d'étude, c'est à dire les thèses scientifiques. Enfin, nous avons mis en place des procédures d'évaluations expérimentales qualitatives et quantitatives, permettant une analyse de performance des résultats des recherches itératives de notre prototype et de les comparer avec le système actuel de CITHER. Cette recherche représente un apport intéressant pour la recherche d'information pertinente dans les thèses, en fournissant au doctorant les moyens de construire facilement sa thèse de manière adaptée. Nos résultats ont permis de valider l'importance de définir la structure sémantique lors de la création de documents afin de mieux exploiter l'information contenu

    Analyzing Polemics Evolution from Twitter Streams Using Author-based Social Networks

    Get PDF
    The construction of social network graphs from online networks data has become nowadays a common track to analyze these data. Typical research questions in this domain are related to profile building, interest’s recommendation, and trending topics prediction. However, few work has been devoted to the analysis of the evolution of very short and unpredictable events, called polemics. Also, experts do not use tools coming from social network graphs analysis and classical graph theory for this analysis. In this way, this article shows that such analysis lead to a colossal amount of data collected from public social sources like Twitter. The main problem is collecting enough evidences about a non-predictable event, which requires capturing a complete history before and during the course of this event, and processing them. To cope with this problem, while waiting for an event, we captured social data without filtering it, which required more than a TB of disk space. Then, we conduct a time-related social network analysis. The first one is dedicated to the study of the evolution of the actor interactions, using time-series built from a total of 33 graph theory metrics. A Big Data pipeline allows us to validate these techniques on a complex dataset of 284 millions of tweets, analyzing 56 days of the Volkswagen scandal

    Accès au contenu des thèses numériques par leur structure sémantique

    No full text
    National audienceLes projets de bibliothèques numériques actuels offrent à l’utilisateur l’accès aux thèses à partir d’une recherche qui ne permet pas d’extraire les parties pertinentes de la thèse et ne renvoie que la thèse intégrale. Ainsi, l’utilisateur doit lire des chapitres entiers pour connaître les parties qui correspondent à son besoin. Le projet CITHER (Consultation en texte Intégral des THèses En Réseau ) de l’INSA de Lyon dans lequel s’inscrit cette étude, porte sur la mise en ligne des thèses. Dans ce projet, nous proposons de permettre un accès pertinent au contenu des thèses grâce à l’utilisation de « tags sémantiques » rajoutés, par le doctorant, au sein de sa thèse lors de la rédaction. L’exploitation de ces tags permet de cibler la recherche et ainsi mieux satisfaire l’utilisateur. Notre travail porte d’une part sur la constitution d’une base de concepts utilisés pour le « tagage » de la thèse puis sur la définition d’un nouveau modèle de documents à partir des différentes structures de la thèse

    Extracción de estructura a partir de descripciones textuales botánicas

    No full text
    El presente proyecto presenta una solución al problema de análisis y edición de textos en un dominio de aplicación específico, así como su inserción a una base de datos. La solución se propone en el contexto de la Biblioteca Digital Florística (FDL), la cual se está desarrollando en el Centro de Informática Botánica del Jardín Botánico de Missouri con la participación del Laboratorio de Tecnologías Interactivas y Cooperativas (ICT) de la Universidad de las Américas Puebla (UDLAP). El objetivo del proyecto FDL es recolectar y publicar información sobre especies de plantas briofitas y vasculares que crecen en diversas regiones, incluyendo la Flora de Norteamérica (FNA), la Flora de China (FOC) y la Flora de Mesoamérica (FM). Sólo en FNA están participando cerca de 800 autores de documentos llamados tratamientos taxonómicos y que representan el elemento de información fundamental de FDL. Cada tratamiento taxonómico contiene una descripción morfológica cuya introducción manual, revisión y edición representa una enorme inversión de tiempo. Esto se debe principalmente a que las descripciones morfológicas, aunque utilizan un lenguaje restringido, no observan un formato fijo, sino que cada descripción contiene un número diferente de características. La solución que se propone demuestra el potencial del uso de una gramática en la determinación de la estructura de la información contenida en un texto determinado dentro de una biblioteca digital. Dado un texto en formato HTML o formato libre el sistema lo analiza para presentárselo al usuario con el fin de su verificación antes de que se actualice la base de datos. Esta transformación es útil también en el proceso de almacenar descripciones morfológicas existentes en una base de datos con un formato preestablecido. El proyecto forma parte de un sistema, más general, de apoyo a los autores de descripciones morfológicas. Con su uso se espera agilizar la construcción de la biblioteca digital además de contribuir a la investigación en el área de extracción de información en una biblioteca digital

    Accès au contenu des thèses numériques par leur structure sémantique

    No full text
    National audienceLes projets de bibliothèques numériques actuels offrent à l’utilisateur l’accès aux thèses à partir d’une recherche qui ne permet pas d’extraire les parties pertinentes de la thèse et ne renvoie que la thèse intégrale. Ainsi, l’utilisateur doit lire des chapitres entiers pour connaître les parties qui correspondent à son besoin. Le projet CITHER (Consultation en texte Intégral des THèses En Réseau ) de l’INSA de Lyon dans lequel s’inscrit cette étude, porte sur la mise en ligne des thèses. Dans ce projet, nous proposons de permettre un accès pertinent au contenu des thèses grâce à l’utilisation de « tags sémantiques » rajoutés, par le doctorant, au sein de sa thèse lors de la rédaction. L’exploitation de ces tags permet de cibler la recherche et ainsi mieux satisfaire l’utilisateur. Notre travail porte d’une part sur la constitution d’une base de concepts utilisés pour le « tagage » de la thèse puis sur la définition d’un nouveau modèle de documents à partir des différentes structures de la thèse

    Accès au contenu des thèses numériques par leur structure sémantique

    No full text
    National audienceLes projets de bibliothèques numériques actuels offrent à l’utilisateur l’accès aux thèses à partir d’une recherche qui ne permet pas d’extraire les parties pertinentes de la thèse et ne renvoie que la thèse intégrale. Ainsi, l’utilisateur doit lire des chapitres entiers pour connaître les parties qui correspondent à son besoin. Le projet CITHER (Consultation en texte Intégral des THèses En Réseau ) de l’INSA de Lyon dans lequel s’inscrit cette étude, porte sur la mise en ligne des thèses. Dans ce projet, nous proposons de permettre un accès pertinent au contenu des thèses grâce à l’utilisation de « tags sémantiques » rajoutés, par le doctorant, au sein de sa thèse lors de la rédaction. L’exploitation de ces tags permet de cibler la recherche et ainsi mieux satisfaire l’utilisateur. Notre travail porte d’une part sur la constitution d’une base de concepts utilisés pour le « tagage » de la thèse puis sur la définition d’un nouveau modèle de documents à partir des différentes structures de la thèse

    From Tweet to Graph: Social Network Analysis for Semantic Information Extraction

    Get PDF
    International audienceThis paper represents a study along the cutting edge of the current analysis of online social network in relation with the contents communicated among users. Twitter data is carefully selected around a fixed hash-tag in order to study the specified content in relation with other contents that users bring to connection. A separate network of hash-tags related (in tweets) is constructed for different days; the networks are analyzed within advanced Gephi package, providing several measures -degree, betweenness centrality, communities, as well as the longest path, by which the evolution of communication around specified concepts is quantified. Our study is absolutely in the current trend of analysis of online social networks that, going beyond mere topology, reveals relevant linguistic and social categories and their dynamics
    corecore