192 research outputs found
CoaKG: A Contextualized Knowledge Graph Approach for Exploratory Search and Decision Making
In decision-making scenarios, an information need arises due to a knowledge gap when a decision-maker needs more knowledge to make a decision. Users may take the initiative to acquire knowledge to fill this gap through exploratory search approaches using Knowledge Graphs (KGs) as information sources, but their queries can be incomplete, inaccurate, and ambiguous. Although KGs have great potential for exploratory search, they are incomplete by nature. Besides, for both Crowd-sourced KGs and KGs constructed by integrating several different information sources of varying quality to be effectively consumed, there is a need for a Trust Layer. Our research aims to enrich and allow querying KGs to support context-aware exploration in decision-making scenarios. We propose a layered architecture for Context Augmented Knowledge Graphs-based Decision Support Systems with a Knowledge Layer that operates under a Dual Open World Assumption (DOWA). Under DOWA, the evaluation of the truthfulness of the information obtained from KGs depends on the context of its claims and the tasks carried out or intended (purpose). The Knowledge Layer comprises a Context Augmented KG (CoaKG) and a CoaKG Query Engine. The CoaKG contains contextual mappings to identify explicit context and rules to infer implicit context. The CoaKG Query Engine is designed as a query-answering approach that retrieves all contextualized answers from the CoaKG. A Proof of Concept (PoC) based on Wikidata was developed to evaluate the effectiveness of the Knowledge Layer
Técnicas Baseadas em Similaridade de Árvores para Extração de Dados da Web em Larga Escala
Neste trabalho será desenvolvido um método automático para o problema de extrair pares valor-atributo presentes em páginas Web ricas em dados. O método será baseado em Algoritmo de Alinhamento de Árvores para encontrar nestas páginas exemplos de pares que correspondem a objetos de interesse. Em seguida, o método deve gerar expressões regulares para extrair pares atributo-valor similares aos exemplos dados.CNP
Um Estudo sobre Técnicas para Verificação de Veracidade em Fusão de Dados da Web
Quando se integra dados extraídos de diversas fontes da Web, é comum a ocorrência de informações conflitantes ou mesmo irreais sobre um mesmo assunto ou entidade. Isso ocorre por diversas razões, indo desde erros não intencionais (ex., erros de grafia) até rumores intencionalmente disseminados com propósitos impróprios. O fato de ser a Web um veículo aberto onde qualquer um pode publicar informações e dados sem prévia avaliação facilita a veiculação de informação incorreta ou imprecisa. Desta forma, um grande desafio que se apresenta em integração de dados da Web é determinar quais informações têm maior qualidade e acurácia, dado um conjunto de informações de fontes diversas e muitas vezes conflitantes. Este desafio demanda o desenvolvimento de métodos e técnicas para ajudar na distinção entre informação verdadeira e falsa na Web. Neste projeto buscamos iniciar a aluna nos estado-da-arte destas técnicas, para em seguida investigar a sua efetividade sobre dados do domínio de comércio eletrônico através de experimentação. Pretende-se ainda Investigar oportunidades de melhoria das técnicas do estado-da-arte para este contexto.CNP
Um Estudo sobre Técnicas para Verificação de Veracidade em Fusão de Dados da Web
Quando se integra dados extraídos de diversas fontes da Web, é comum a ocorrência de informações conflitantes ou mesmo irreais sobre um mesmo assunto ou entidade. Isso ocorre por diversas razões, indo desde erros não intencionais (ex., erros de grafia) até rumores intencionalmente disseminados com propósitos impróprios. O fato de ser a Web um veículo aberto onde qualquer um pode publicar informações e dados sem prévia avaliação facilita a veiculação de informação incorreta ou imprecisa. Desta forma, um grande desafio que se apresenta em integração de dados da Web é determinar quais informações têm maior qualidade e acurácia, dado um conjunto de informações de fontes diversas e muitas vezes conflitantes. Este desafio demanda o desenvolvimento de métodos e técnicas para ajudar na distinção entre informação verdadeira e falsa na Web. Neste projeto buscamos iniciar a aluna nos estado-da-arte destas técnicas, para em seguida investigar a sua efetividade sobre dados do domínio de comércio eletrônico através de experimentação. Pretende-se ainda Investigar oportunidades de melhoria das técnicas do estado-da-arte para este contexto.CNP
A signature-based bag of visual words method for image indexing and search
Conselho Nacional de Desenvolvimento Científico e Tecnológico (CNPq)In this paper, we revisit SDLC, an image retrieval method that adopts a signature-based approach to identify visual words, instead of the more conventional approach that identifies them by using clustering techniques. We start by providing a formal and generalized definition of the approach adopted in SDLC, which we call Signature-Based Bag of Visual Words. After that, we present a detailed study of SDLC parameters and experiments with distinct weighting schemes used to compute the ranking of results, comparing the method to well-known cluster-based bag of visual words approaches. When compared to the initial proposal of SDLC, the choice of different parameters and a new weighting scheme allowed us to considerably reduce the size of the textual representation generated by the method, reducing also the indexing times and the query processing times in all collections adopted in the experiments. Further, the SDLC outperforms the baselines in most of these collections. (C) 2015 Elsevier B.V. All rights reserved.In this paper, we revisit SDLC, an image retrieval method that adopts a signature-based approach to identify visual words, instead of the more conventional approach that identifies them by using clustering techniques. We start by providing a formal and ge6517FAPEAM - FAPEAM - FUNDAÇÃO DE AMPARO À PESQUISA DO ESTADO DO AMAZONASCNPQ - CONSELHO NACIONAL DE DESENVOLVIMENTO CIENTÍFICO E TECNOLÓGICOConselho Nacional de Desenvolvimento Científico e Tecnológico (CNPq)SEM INFORMAÇÃOSEM INFORMAÇÃOThis research was sponso red by project E-vox pesquisa/FAPEAM and by individual CNPq fellow ship grants (Edleno S. de Moura, Altigran S. da Silva and Ricardo Torres
Iniciação Científica em Métodos Probabilísticos para Extração de Dados de Fontes Textuais
Este projeto consiste no estudo, implementação e experimentação de métodos, técnicas e ferramentas para Extração de Dados de Fontes Textuais usando Métodos Probabilísticos. O projeto será desenvolvido a partir do método ONDUX (On Demand Unsupervised Extraction) e tem entre suas metas a criação de uma ferramenta de extração de informação utilizando este método e a investigação de sua aplicabilidade em outros cenários ainda não consideradosCNP
Uma estratégia genérica para casamento aproximado de instâncias
Casamento aproximado de instâncias é um problema central em muitos processos de gerenciamento de dados, tais como integração de dados, data cleaning e consulta aproximada. O principal objetivo de casamento aproximado é determinar se duas instâncias representam o mesmo objeto do mundo real. Para valores atômicos, diversas funções de similaridade têm sido definidas, que geralmente são dependentes do domínio de valores. Por outro lado, casamento de valores agregados, como tuplas ou árvores XML, ainda é um problema importante. Neste cenário, dois problemas podem ser identificados. O primeiro diz respeito a como os resultados gerados por diferentes funções de similaridade devem ser combinados em um escore único, ou para um escore normalizado. Funções individuais geralmente geram escores que não são comparáveis, pode-se obter diferentes distribuições a partir de cada função. Isto significa que não existe uma forma simples de combinar escores gerados por funções de similaridade distintas usando uma medida simples, em casamento de agregados. Nesta tese, a proposta é, ao invés de utilizar os escores originalmente gerados pelas funções de similaridade, aplicar um método para estimar a precisão dos resultados de cada função, e usar esta precisão estimada como um escore ajustado. Através deste método, a proposta apresentada nesta tese envolve duas contribuições a este problema. Primeiro, é possível permitir que o usuário especifique valores de ponto de corte (thresholds) que sejam significativos, usando para isso um valor de precisão ajustada como um escore de similaridade Além disso, usando o escore ajustado, são obtidos resultados mais precisos em um processo de casamento aproximado de agregados. O segundo problema, surge quando os escores são combinados em casamento de agregados, e diz respeito à função de similaridade utilizada para combinar os valores. Particularmente, um agregado pode ser estruturado de diferentes maneiras, tais como tupla, conjunto e lista. O processo de combinação usado em cada caso deve ser distinto, a fim de se alcançar resultados mais exatos. Entretanto, não é claro como escores de similaridade individuais podem ser combinados para calcular, apropriadamente, escores para um agregado. O processo de combinação deveria ser distinto em cada caso. A contribuição apresentada para este problema é a definição de funções de similaridade específicas para cada tipo de agregado, dependendo da estruturação. Palavras-chave: Similaridade, funções de similaridade, casamento de instâncias, revocação e precisão
Iniciação Científica em Métodos Probabilísticos para Extração de Dados de Fontes Textuais
Este projeto consiste no estudo, implementação e experimentação de métodos, técnicas e ferramentas para Extração de Dados de Fontes Textuais usando Métodos Probabilísticos. O projeto será desenvolvido a partir do método ONDUX (On Demand Unsupervised Extraction) e tem entre suas metas a criação de uma ferramenta de extração de informação utilizando este método e a investigação de sua aplicabilidade em outros cenários ainda não consideradosCNP
Efficient XML Structural Similarity Detection using Sub-tree Commonalities
Developing efficient techniques for comparing XML-based documents becomes essential in the database and information retrieval communities. Various algorithms for comparing hierarchically structured data, e.g. XML documents, have been proposed in the literature. Most of them make use of techniques for finding the edit distance between tree structures, XML documents being modeled as ordered labeled trees. Nevertheless, a thorough investigation of current approaches led us to identify several unaddressed structural similarities, i.e. sub-tree related similarities, while comparing XML documents. In this paper, we provide an improved comparison method to deal with such resemblances. Our approach is based on the concept of tree edit distance, introducing the notion of commonality between sub-trees. Experiments demonstrate that our approach yields better similarity results with respect to alternative methods, while maintaining quatratic time complexity.Includes bibliographical references
Proceedings of the 10th Alberto Mendelzon International Workshop on Foundations of Data Management, Panama City, Panama, May 8-10, 2016
- …
