1,721,009 research outputs found

    Automatic language-independent detection of multiword descriptions for text summarization

    No full text
    En las últimas dos décadas un aumento exponencial de la información electrónica provoca una gran necesidad de entender rápidamente grandes volúmenes de información. En esta tesis se desarrollan los métodos automáticos para producir un resumen. Un resumen del texto es un texto corto que transmite la información más importante del documento o de una colección de documentos. El tipo de resúmenes con el cual trabajamos en esta tesis son resúmenes extractivos: una selección de las oraciones del texto más importantes. Otros retos consisten en generar resúmenes de manera independiente de lenguaje y dominio. La primera contribución de esta tesis consiste en identificar cuatro etapas para generación de resúmenes extractivos. La primera etapa es la selección de términos donde uno tiene que decidir que unidades contarían como los términos individuales. El proceso de estimación de la utilidad de los términos individuales se llama la etapa de pesado de términos. El siguiente paso se denota como pesado de oraciones donde todas las secuencias reciben alguna medida numérica de acuerdo a la utilidad de términos. Finalmente, el proceso de selección de las oraciones más importantes se llama selección de oraciones. Los diferentes métodos para generación de resúmenes extractivos se pueden ser caracterizados como representan estas etapas. Las contribuciones principales en la etapa de selección de términos que hemos propuesto es la detección de descripciones multipalabra considerando Secuencias Frecuentes Maximales (SFMs), cuales adquieren un significado importante mientras Secuencias Frecuentes (SF) no maximales los cuales son partes de otros SF, no deben de ser consideradas. En la motivación se consideró costo vs. beneficio: existe muchas SF no maximales mientras la probabilidad de adquirir un significado importante es baja. De todos modos, SFMs representan todas SFs en el modo compacto: todas SFs podrían ser obtenidas a partir de todas SFMs explotando cada SFM al conjunto de todas sus subsecuencias. Otras contribuciones de este trabajo son nuevos métodos basados en grafos, algoritmos de agrupamiento, y algoritmo genético cuales facilitan la tarea de generación de resúmenes de textos. Se ha experimentado diferentes combinaciones de las opciones de selección de términos, pesado de términos, pesado de oraciones y selección de oraciones para generar los resúmenes extractivos de textos independiente de lenguaje y dominio para una colección de noticias. Se ha analizado algunas opciones basadas en descripciones multipalabra considerándolas en los métodos de grafos, algoritmos de agrupamiento y algoritmos genéticos. Se ha obtenido los resultados superiores al de estado de arte

    Determinación del desempeño de resúmenes generados automáticamente para el idioma español

    No full text
    En la actualidad el crecimiento rápido de internet ha provocado gran cantidad de información que está disponible en formato electrónico que crece de manera exponencial. Esto da lugar a millones de documentos cuya magnitud dificulta en gran medida su manejo. Esto lleva a la búsqueda de nuevos programas que suplan las tareas cada vez más específicas. Por ejemplo, cuando se quiere saber más de un tema es necesario revisar más de un documento ya sea en internet o en la computadora. Después se necesita identificar un documento con mayor relevancia de información para nuestros fines. Lo que facilitaría la tarea de búsqueda es si pudiéramos tomar solamente las partes más relevantes (documentos, renglones, oraciones, frases o palabras) y leer solo lo importante. Precisamente estas partes formarían un resumen de un tema buscado. Un resumen se define como un texto muy corto que comunica la información más importante del documento original (Ledeneva 2008). Esta tesis se trata de la generación automática de resúmenes, que es una tarea de gran utilidad para hacer las tareas más rápidas con ayuda de una herramienta. En el presente trabajo se evaluan las diferentes herramientas comerciales tanto en línea como las que son instalables para saber su desempeño en el idioma español. Los experimentos se llevan a cabo sobre el corpus TER (corpus en español). Posteriormente, el desempeño de las herramientas comercioales se compara con el método del estado de arte de (Matias 2016), ya que se había probado como uno de los mejores métodos para los idiomas inglés y portugués (Matias 2013, Ibañez 2013)

    Evaluación de sistemas para la extracción de frases clave

    No full text
    Hoy en día, la cantidad de información electrónica en forma de texto ha aumentado considerablemente por lo que una búsqueda de información puede traer consigo varios documentos recuperados. Posteriormente, los documentos recuperados se tienen que revisar para saber si contienen lo que realmente se busca. Una manera de simplificar una búsqueda es el empleo de palabras o frases clave ya que actúan como filtro en un campo de búsqueda. Las palabras o frases clave se utilizan en muchas áreas, por ejemplo, la mercadotecnia y publicidad, en donde el objetivo es capturar la atención del público. De igual forma, en todo aquello que se quiere dar a conocer hacia el público en general. Ya sean documentos de textos impresos o electrónicos, las frases clave ayudan al lector mostrándole las ideas principales del texto. En esta tesis, se comparan los sistemas de extracción automática de frases clave sobre un conjunto de artículos científicos utilizados en la tarea 5 del SemEval-2010, con el objetivo de conocer qué sistemas pueden encontrar las frases clave que fueron propuestas por un ser humano. En la experimentación se presentan los resultados de la comparación entre los sistemas instalables y en línea. Por último, los resultados de la evaluación se comparan con los de la tarea 5 del SemEval-2010

    Generación automática de resúmenes de múltiples documentos utilizando secuencias frecuentes maximales y método de grafos

    Get PDF
    El crecimiento exponencial de internet ha provocado un bombardeo de información que se produce día a día aumentando de manera exponencial. La información masiva se ha vuelto un problema de sobrecarga de información al momento de realizar una búsqueda de información específica, lo cual ha provocado que las ciencias computacionales se vean involucradas en la búsqueda de una solución. La Generación Automática de Resúmenes de Texto (GART) es una tarea del Procesamiento del Lenguaje Natural (PLN) que busca contrarrestar los efectos negativos de la sobrecarga de información. Actualmente existen diferentes métodos del estado del arte para la GART basados en una arquitectura de tres etapas: 1. Identificación de Tópicos. 2. Transformación o interpretación. 3. Síntesis o generación del resumen. Entre los métodos del estado del arte se encontró un método que a diferencia de los otros propone una cuarta etapa. La cuarta etapa busca darle un valor a cada término de las oraciones. El método propuesto por (Ledeneva y García-Hernández, 2017) demostró dar buenos resultados para la tarea Generación Automática de Resúmenes de Texto de Un solo documento (GART-1). Con referencia a los resultados obtenidos del método de (Ledeneva y García-Hernández, 2017) en este trabajo se propone ajustar los parámetros en las diferentes etapas y adaptar el método para la tarea de Generación Automática de Resúmenes de Texto de Múltiples documentos (GART-M). En el método propuesto se optó por la extracción de las Secuencias Frecuentes Maximales (SFM’s) para ser empleadas como modelo de texto y la utilización de un método basado en grafos para realizar el pesado de las oraciones. El corpus empleado fue DUC-02, el cual está conformado por 59 colecciones de documentos de noticias. La evaluación de los resúmenes se hizo con el sistema ROUGE-N, el cual permite comprar los resúmenes generados a partir del método con los resúmenes generados por un humano. Los resultados obtenidos de los experimentos realizados se dividieron en tres etapas. En la primera etapa se buscó la mejor configuración del método. En la segunda etapa se buscó probar la importancia de la longitud de las SFM’s. En la tercera etapa de busco emplear una nueva configuración para la selección de oraciones. Los resultados obtenidos por el método propuesto se compararon con otros métodos del estado del arte y las heurísticas. Los resultados obtenidos con el método propuesto logran superar las heurísticas y métodos del estado del arte

    Evaluación de herramientas comerciales y métodos del estado del arte para la generación de resúmenes en idioma ruso

    No full text
    Con el crecimiento exponencial de la información, la tarea de su comprensión se vuelve más difícil. Una forma de ayudar en esta tarea, es mediante la generación automática de resúmenes de texto. El objetivo de estos resúmenes, es presentar el contenido en una versión más corta que la del texto original, y que permita al usuario comprender más rápido el gran volumen de información. Los métodos de integración de textos se pueden clasificar en extractivos y abstractivos. Los resúmenes abstractivos utilizan métodos lingüísticos para examinar e interpretar el texto y luego encontrar nuevos conceptos y expresiones, para describir mejor la generación de un nuevo texto más corto, que trasmite la información más importante del documento original Debido a esto, tales resúmenes hasta hoy los realizan los seres humanos. Por su parte, un resumen extractivo está compuesto con fragmentos del documento original. El principal objetivo de la generación de resúmenes extractivos es la selección automática de frases (frases, oraciones o párrafos) de texto que reflejarían de manera adecuada el contenido del documento. Estos últimos son los que se utilizan para la generación automática de resúmenes. Dado que los trabajos tomados en cuenta del estado del arte, operan con corpus en idiomas inglés, portugués y español. Surge el interés de conocer la calidad de las herramientas comerciales si se utiliza en otro idioma. En el presente trabajo de tesis se realiza la evaluación de las herramientas comerciales y los métodos del estado del arte para la generación automática de resúmenes en el idioma ruso. Para la selección de las herramientas comerciales se analizaron cuáles de ellas están a disposición, y a su vez realizan resúmenes en idioma ruso. Las herramientas comerciales seleccionadas en línea fueron: Open Text Summarizer, Text Compactor, Tools4noobs, T-Conspectus. Las herramientas comerciales instalables elegidas fueron: Microsoft Word 2003 y Microsoft Word 2007, en estas dos últimas herramientas se probaron en los sistemas operativos Windows: VISTA, XP, 7 Ultimate y 8. La selección de los métodos del estado del arte, se tomaron en cuenta los trabajos más relacionados de los cuales se tiene mayor información. La aportación de este trabajo es la creación del corpus en el idioma ruso que lleva por el nombre TEXTRUSS. Está compuesto de 242 noticias contenidas en 11 categorías, con la finalidad de tener mayor diversidad de temas. Tal corpus se utiliza para generar resúmenes tanto como para las herramientas comerciales como para los métodos del estado del arte. La segunda aportación consiste en realizar la evaluación de herramientas comerciales y métodos del estado de arte. Para la evaluación de los resúmenes se utilizó el sistema ROUGE el cual mide la similitud y determina la calidad de un resumen automático. Se muestran los resultados obtenidos

    EVALUACIÓN DE LA CALIDAD DE LAS HERRAMIENTAS COMERCIALES Y MÉTODOS DEL ESTADO DEL ARTE PARA LA GENERACIÓN DE RESÚMENES DEL CORPUS DUC-2001

    No full text
    Debido a la gran cantidad de información digital que existe actualmente, a la hora de realizar una búsqueda sobre un tema podemos encontrar millones de documentos (libros, revistas, periódicos, artículos, etc.). Este tipo de problemas puede ocasionar que las personas no cuenten con el tiempo suficiente para leer cada documento y encontrar la información de interés, por lo que contar con herramientas, en este caso los resúmenes, que faciliten la identificación de los temas entre una gran cantidad de documentos es de gran ayuda. Un resumen es un texto corto que comunica la información más importante del mismo (Ledeneva, 17). Un resumen puede ser de tipo extractivo o abstractivo. La construcción de los resúmenes automáticos extractivos consiste en una selección de oraciones (párrafos, frases, cláusulas de la oración, etc.) más relevantes del documento original. Por otro lado, los resúmenes abstractivos se realizan a través de parafraseo, fusión de las palabras, frases, conceptos, etc., para lo cual se requiere utilizar recursos lingüísticos sofisticados que aún requieren investigaciones del estado del arte. En esta tesis se trabaja con resúmenes automáticos extractivos. Existen dos tipos de tarea en la Generación Automática de Resúmenes (GAR): GAR de un solo documento y GAR de múltiples documentos. La GAR de un solo documento consiste en extraer un resumen de un documento, mientras la GAR de múltiples documentos consiste en extraer un resumen de varios documentos. En esta tesis, se trabaja la tarea de la GAR de un solo documento. Existen varias herramientas comerciales y métodos del estado del arte para la GAR extractivos de un solo documento en el idioma inglés. El corpus más utilizado para la experimentación de los métodos del estado del arte es el corpus DUC-2002 en el idioma inglés, por lo que se hace difícil comparar los trabajos del estado del arte con otros corpus. Por tal motivo, se propone utilizar otro corpus que sea diferente del DUC2002, para determinar la calidad de las herramientas comerciales y métodos del estado del arte y formar un estado del arte de la GAR extractivos con los datos del corpus DUC-2001. Dicho corpus contiene 309 noticias de diferentes temas, y cuenta con dos resúmenes de oro hechos por dos humanos. Para la evaluación de las herramientas comerciales y métodos del estado del arte se utiliza la herramienta ROUGE (Lin, 04). Esta herramienta utiliza tres medidas (Precisión, Recuerdo y F-measure) para determinar la calidad de un resumen automático

    Evaluación de sistemas de extracción de frases clave.

    No full text
    El manejo de información en la actualidad es un factor de gran importancia dentro de los sectores públicos y privados. Con el crecimiento constante de los volúmenes de información electrónica, ésta requiere ser organizada para su uso. Con la tecnología que se cuenta hoy en día, el manejo de la información se ha facilitado. Dentro del área de Procesamiento de Lenguaje Natural una de las disciplinas que la integran es la Recuperación de Información (RI). La RI es el proceso de encontrar en un repositorio grande de datos, material (usualmente documentos) de naturaleza no estructurada (usualmente texto) o semiestructurada (páginas Web) que satisfaga una necesidad de información [Manning 09]. Para lograr la RI, existen varios sistemas, estos reciben el nombre de sistemas de recuperación de información. Un Sistema de Recuperación de Información (SRI) consiste básicamente de un conjunto de procesos interrelacionados que permiten obtener información de interés, a partir de una determinada consulta [Jiménez 03]. Un ejemplo de un SRI es un buscador Web, ya que se ingresa una búsqueda y este devuelve los resultados que han coincidido con el texto de entrada.Hoy en día, la cantidad de información electrónica en forma de texto ha aumentado considerablemente por lo que una búsqueda de información puede traer consigo varios documentos recuperados. Posteriormente, los documentos recuperados se tienen que revisar para saber si contienen lo que realmente se busca. Una manera de simplificar una búsqueda es el empleo de palabras o frases clave ya que actúan como filtro en un campo de búsqueda. Las palabras o frases clave se utilizan en muchas áreas, por ejemplo, la mercadotecnia y publicidad, en donde el objetivo es capturar la atención del público. De igual forma, en todo aquello que se quiere dar a conocer hacia el público en general. Ya sean documentos de textos impresos o electrónicos, las frases clave ayudan al lector mostrándole las ideas principales del texto. En esta tesis, se comparan los sistemas de extracción automática de frases clave sobre un conjunto de artículos científicos utilizados en la tarea 5 del SemEval-2010, con el objetivo de conocer qué sistemas pueden encontrar las frases clave que fueron propuestas por un ser humano. En la experimentación se presentan los resultados de la comparación entre los sistemas instalables y en línea. Por último, los resultados de la evaluación se comparan con los de la tarea 5 del SemEval-2010

    DESEMPEÑO DE LOS MÉTODOS DEL ESTADO DEL ARTE PARA LA GENERACIÓN AUTOMÁTICA DE RESÚMENES EXTRACTIVOS PARA EL CORPUS TEXTRUSS

    Get PDF
    Hoy en día la información digital crece de manera exponencial. Por esto, cuando se realiza una investigación sobre un tema específico en un motor de búsqueda (Google Search, Yahoo! Search) nos genera demasiados resultados, por lo cual se complica revisar todos los documentos recuperados que contengan las palabras de la consulta. Uno de los recursos más eficientes utilizados por los usuarios para condensar el volumen de información es el uso de resúmenes. Un resumen es un texto corto producido a partir de uno o más documentos, clasificado en abstractivo o extractivo. El resumen extractivo se crea a partir de la selección de oraciones sobresalientes del texto original, por otro lado, el resumen abstractivo consiste en interpretar el texto en menos palabras. Además, existen dos tareas en la generación de un resumen: a partir de un solo documento o a partir de múltiples documentos. El resumen generado de un solo documento consiste en generar un texto corto, mientras que el resumen generado por múltiples documentos consiste en generar un texto corto con los elementos relevantes de éstos. En este trabajo de tesis se utiliza el resumen de tipo extractivo y con la tarea de un solo documento. Se han elaborado diversos trabajos que determinan el desempeño de las herramientas comerciales y métodos del estado del arte para la generación automática de resúmenes en el idioma inglés, español, portugués y ruso; utilizando conjuntos de documentos como entrada llamados corpus, los cuales son orientados al dominio de noticias. Sin embargo, en el caso del idioma ruso no se han utilizado diversos métodos del estado del arte. En este trabajo de tesis se determina el desempeño de los métodos del estado del arte para la generación automática de resúmenes extractivos de un solo documento utilizando el corpus TEXTRUSS, por medio de la herramienta de evaluación ROUGE (Lin, 2004), utilizando la medida F-measure como indicador de evaluación. Se realizaron experimentos con diferentes configuraciones de parámetros de los métodos del estado del arte para la generación automática de resúmenes en el idioma ruso. Además, se comparan los resultados de los métodos del estado del arte para determinar su desempeño

    Generación automática de resúmenes basada en n-gramas sintácticos

    No full text
    Tesis (Doctorado en Ciencias de la Computación), Instituto Politécnico Nacional, CIC, 2017, 1 archivo PDF, (105 páginas). tesis.ipn.m
    corecore