1,720,992 research outputs found
Comparação de desempenho entre bancos de dados relacionais e de grafo RDF no contexto do armazenamento de dados do transporte público
Dados sobre a infraestrutura de transporte público de uma cidade geralmente são disponibilizados em formato tabular pelos órgãos responsáveis em repositórios de dados abertos. Essa forma de disponibilização facilita seu uso na carga de bancos relacionais. No entanto, nos últimos anos, foram mostrados os benefícios do armazenamento desse tipo de dado em bancos de grafos. Este trabalho tem como objetivo comparar a implementação dos dois tipos bancos de dados quando populados com os dados do GTFS (General Transit Feed Specification) da cidade do Rio de Janeiro. A comparação é feita avaliando três bancos, dois relacionais e um terceiro em grafos RDF construído a partir da ontologia Linked GTFS Ontology, sob a ótica do tempo de execução de um grupo de consultas, seguindo a metodologia apresentada em (Chaves-Fraga et al., 2020). Os resultados obtidos indicam um melhor desempenho para os bancos relacionais do que para o banco de dados em grafos RDF na execução das consultas
Automatização da revisão de literatura científica com geração aumentada por recuperação
A revisão de literatura, embora essencial para a pesquisa científica, é muitas vezes percebida como uma etapa exploratória demorada, que poderia ser melhor aproveitado para pensamento crítico e na experimentação. Os Grandes Modelos de Linguagem (LLMs) revolucionaram a busca de informações, fazendo uma transição da exploração ativa para uma experiência mais passiva de recuperação de informação. No entanto, quando utilizados como fonte primária de conhecimento, os modelos muitas vezes produzem conteúdo impreciso ou “alucinado” e carecem de atualizações de informações em tempo real, devido à dependência da memória paramétrica do modelo. O paradigma da Geração Aumentada por Recuperação (RAG) surgiu como uma solução para esses desafios de lidar com tarefas de intenso uso de conhecimento, combinando a robusta capacidade da recuperação de informação tradicional com a sofisticada geração de texto de LLMs. Este estudo pro põe utilizar a arquitetura RAG para auxiliar na automatização da fase de levantamento
bibliográfico para revisões de literatura, contando com uma recuperação de documentos relevantes aprimorada, com maior compreensão do conteúdo dos documentos, e uma experiência de usuário enriquecida por meio de sumarização do material e síntese da relevância dos resultados. O objetivo é simplificar o processo de busca, com resultados mais relevantes e permitindo uma pré-seleção mais eficiente, através das sumarizações. O estudo foca em documentos científicos em português, para expandir o campo de estudo para além do inglês. Os resultados finais são promissores para recuperação e geração, indicando potencial para ampliar a pesquisa para um banco de dados mais completo
Evaluation and recommendation of collaborations on academic social networks
No contexto acadêmico o trabalho de pesquisa científica, nas áreas tecnológicas, é efetuado através de colaborações e cooperações entre diferentes pesquisadores e grupos de pesquisa. Existem pesquisadores atuando nos mais variados assuntos e nas mais diversas subáreas de pesquisa. Para analisar e expandir tais colaborações, muitas vezes, é necessário avaliar o nível de cooperação dos atuais parceiros, bem como identificar novos parceiros para conduzir trabalhos conjuntos. Tal avaliação e identificação não são tarefas triviais. Dessa forma, abordagens para avaliação e recomendação de colaborações são de grande valia para o aperfeiçoamento da cooperação e consequente melhoria da qualidade da pesquisa. Em relação à análise de colaborações, a demanda por critérios de avaliação de qualidade e por métodos de avaliação associados está aumentando e tem sido foco de muitos estudos na última década. Esse crescimento surge devido à busca por excelência acadêmica e para o apoio à tomada de decisões por parte de agências de financiamento para a alocação de recursos. Nesse contexto, há uma tendência a empregar técnicas bibliométricas, especialmente métodos estatísticos aplicados a citações. Com tanto material sendo pesquisado e publicado, resolveu-se explorar outra faceta para definição de indicadores de qualidade no contexto acadêmico visando a obtenção de resultados complementares e que garantam, através de sua validação experimental, uma melhor geração de indicadores. Desse modo, nesta tese, utiliza-se a tendência atual de estudos em análises de redes sociais, definindo métricas sociais específicas para definição de tais indicadores. Neste trabalho, é apresentada uma função para avaliação de qualidade de grupos de pesquisa com base nas colaborações internas entre seus pesquisadores membros. Estas colaborações são avaliadas através de análises em redes sociais bibliográficas acadêmicas baseadas em métricas de interação social. Com relação à identificação ou recomendação de colaborações, esta tese apresenta uma abordagem que considera tanto a parte de conteúdo quanto a de estrutura de uma rede. Especificamente, o conteúdo envolve a correlação entre os pesquisadores por áreas de pesquisa, enquanto a estrutura inclui a análise da existência de relacionamentos prévios entre os pesquisadores. Grande parte das abordagens que efetuam a recomendação de colaborações foca em recomendar especialistas em uma determinada área ou informação. Essas não consideram a área de atuação do usuário alvo da recomendação, como no caso da abordagem apresentada nesta tese. Além disso, neste trabalho, a obtenção de informações sobre os relacionamentos entre usuários, para construção de uma rede social acadêmica, é feita de forma implícita, em dados sobre publicações obtidos de bibliotecas digitais. Utilizando tais dados, também é possível explorar aspectos temporais para ponderação desses relacionamentos, utilizando-os para fins de recomendação de colaborações. Não foram encontrados trabalhos prévios nesse sentido. A presente abordagem inclui a recomendação não só de novas colaborações, como também, a recomendação de intensificação de colaborações já existentes, o que não é considerado por outros trabalhos relacionados. Dessa forma, pode-se dizer que os objetivos de recomendação da presente abordagem são mais amplos. Após propor novas técnicas para avaliação e identificação de parcerias, esta tese as valida através de uma avaliação experimental. Especificamente, experimentos com dados reais sobre as relações de coautoria entre pesquisadores pertencentes a diferentes grupos de pesquisa são apresentados para avaliação e demonstração da validade e da aplicabilidade das diferentes proposições desta tese referentes à avaliação de qualidade e recomendação de colaborações.In technological fields, scientific research is performed through collaboration and cooperation of different researchers and research groups. In order to analyze and expand such collaborations, it is necessary to evaluate the level of cooperation between current partners as well as to identify new partners. Such an analysis and identification are not trivial tasks. Thus, approaches to evaluating and recommending collaborations are valuable to improve cooperation and, hence, improve research quality. Regarding the collaborations evaluation, the demand for quality assessment criteria and associated evaluation methods is increasing. Indeed, such evaluations have been the focus of many studies in the last decade. This growth arises from the pursuit of academic excellence and decision making of funding agencies. In this context, the trend is to employ bibliometric techniques, especially citation statistics. With so much material being researched and published, another facet for defining quality indicators is explored. Our goal is to obtain additional results that ensure, through its experimental validation, a better indicators generation. In this thesis, the current trend of studies in social network analysis is applied in the definition of such indicators. Specifically, we introduce a function for quality assessment of research groups based on internal collaborations among their member researchers. These collaborations are evaluated through analysis on bibliometric academic social networks based on metrics of social interaction. Regarding the collaborations recommendation, this thesis presents an approach that considers both the content and structure of research networks. The content involves the correlation among researchers by research areas whereas the structure includes the analysis of existing relationships among researchers. Most of the approaches that perform the collaborations recommendation focus on recommending experts in a certain area or information. They do not consider the working area of the recommendation target user, as we do in this thesis. Moreover, here, the information about the researchers’ relationships, employed for building an academic social network, is implicitly obtained through publications data available in digital libraries. Moreover, we expand previous analysis by considering temporal aspects to determine the relationships weights (which may be used to collaborations recommendation purposes). There were no previous studies in this direction. Our approach includes not only the recommendation of new collaborations, but also the recommendation of the collaborations intensification, which is not considered by other related work. After proposing new techniques for evaluating and identifying research collaborators, this thesis validates it through an experimental evaluation. Specifically, we evaluate and demonstrate the applicability of our techniques considering real datasets on the co-author relationships among researchers from different research groups
Analyzing stock market data using unsupervised learning techniques
Compreender o mercado financeiro pode ser desafiador, especialmente para investidores que precisam lidar com uma grande quantidade de informações, termos técnicos e variações nos preços dos ativos. Este projeto busca facilitar esse processo ao analisar como diferentes indicadores financeiros– como volatilidade, capitalização de mercado e rendimento de dividendos– podem ajudar na categorização de empresas. utilizando técnicas como a Análise de Componentes Principais (PCA) para redução de dimensionalidade e métodos de clusterização, como o K-Means, o estudo identifica padrões e semelhanças entre os ativos. Isso permite agrupar empresas com características financeiras semelhantes, tornando a avaliação de risco e a busca por oportunidades de investimento mais intuitivas. Por exemplo, é possível identificar clusters de empresas mais voláteis e com menor retorno, que podem representar investimentos de maior risco, assim como empresas com retornos mais estáveis e menor volatilidade, que podem interessar a perfis mais conservadores. A PCA contribui para a simplificação da análise ao destacar os fatores mais relevantes, ajudando a filtrar ruídos e priorizar as informações mais úteis para a tomada de decisão. Embora essas ferramentas não ofereçam garantias sobre o desempenho futuro dos investimentos, elas ajudam a estruturar os dados de forma mais clara, permitindo que investidores tomem decisões mais informadas. O objetivo principal do projeto é tornar a análise do mercado mais acessível, principalmente para iniciantes, ao oferecer uma visão mais organizada e visual dos dados. Dessa forma, tanto investidores experientes quanto novos participantes do mercado podem usar essas informações para entender melhor os riscos, identificar oportunidades e desenvolver estratégias com mais confiança
Estudo comparativo de ferramentas de visualização e construção de dashboard para dados do VODAN BR
A visualização de dados tornou-se uma ferramenta importante para a exploração e transmissão de resultados de análises sobre dados complexos, especialmente na comunicação científica. No contexto da pandemia de COVID-19, que assolou o mundo nos últimos anos, foi criada a Rede de Implementação Virus Outbreak Data Network (VODAN), com o objetivo de permitir o livre acesso à informação através da criação de uma infraestrutura federada. A Fiocruz, UFRJ, UNIRIO e a Universidade de Twente colaboraram para criar o VODAN BR, que é o representante nacional da rede VODAN. Instituições como o HUGG, o hospital municipal São José de Duque de Caxias e o Hospital Israelita Albert Einstein estão entre seus parceiros. Este trabalho apresenta um estudo comparativo entre ferramentas de visualização diferentes, com o intuito de selecionar a mais adequada para ser utilizada na criação de um dashboard que torne possível realizar, de forma visual e
facilitada, análises, explorações e visualizações sobre os conjuntos de dados do VODAN BR e também sobre seus metadados associados. A pesquisa foi baseada em pontos fortes e fracos de cada ferramenta e no quão compatíveis as mesmas são com as necessidades do projeto. Para atender às necessidades do VODAN BR, o Looker Studio foi a ferramenta mais adequada
Sistema para auxílio no planejamento acadêmico de alunos através de visualizações e recomendações
Desenvolvimento de um sistema para auxílio no planejamento acadêmico através da visualização dos dados de progresso no curso e recomendação de disciplinas para os alunos do Bacharelado em Ciência da Computação da Universidade Federal do Rio de Janeiro. Inicialmente, foram realizadas pesquisas com professores orientadores acadêmicos e alunos, com o intuito de encontrar funcionalidades importantes para serem implementadas no sistema e entender quais características devem ser consideradas no momento da escolha da grade de disciplinas a serem cursadas. Em seguida, foram obtidos os dados dos alunos junto ao SIGA (Sistema Integrado de Gestão Acadêmico), para serem utilizados no sistema, com o consentimento da coordenação do curso. Estudando os dados e analisando o resultado das pesquisas, foi proposto um sistema de recomendação de disciplinas, aplicando os conceitos aprendidos durante a disciplina de Recuperação de Informação e com funcionalidades úteis para ambos, alunos e professores orienta- dores. No sistema, é possível acompanhar o progresso dos alunos, ver ranqueamento de disciplinas e receber recomendação de grades ao início do período. Por fim, o sistema foi apresentado e testado com alguns alunos e professores com a finalidade de obter avaliações e insumos para melhorias no futuro
Auditoria ética de sistemas de IA: uma abordagem prática com modelos de linguagem
Haja vista o crescimento de inteligências artificiais nos últimos anos, se faz necessária a análise de seu desenvolvimento sob a perspectiva ética, visando, para além do avanço tecnológico, as suas projeções e impactos sobre a sociedade. Este trabalho investiga, então, se sistemas baseados em modelos de linguagem de grande escala (LLMs) estão alinhados a princípios éticos, considerando critérios como viés, interpretabilidade, explicabilidade, veracidade, privacidade, desempenho, responsabilidade e agência humana. Para atingir esse objetivo, foi realizada uma revisão bibliográfica sobre auditorias e abordagens aplicáveis a LLMs. Em seguida, foram criados e executados experimentos próprios inspirados em estudos prévios, usados para avaliar o modelo GPT-4o. Os resultados, analisados segundo métricas definidas para cada um dos critérios, permitem tirar conclusões sobre o desempenho da LLM em tais princípios. Portanto, a pesquisa demonstra a relevância de se auditar eticamente sistemas de IA, contribuindo para uma discussão mais ampla e informada sobre a implementação responsável dessa tecnologia
BAMPORT: construção de uma base de dados multimodal para análise de músicas em português
A música, muito presente no cotidiano das pessoas, tornou-se ainda mais acessível com a popularização das plataformas digitais, o que gerou uma crescente demanda por métodos eficazes de classificação automática de gêneros musicais. Este trabalho apresenta a base de dados BAMPORT, uma base robusta projetada para integrar características textuais e acústicas de músicas em português, com o objetivo de aprimorar a precisão na categorização musical. A BAMPORT resultou na criação de um conjunto de dados abrangente, que inclui 198 atributos e 27.777 instâncias. Esses atributos são compostos por 13 atributos de metadados, 14 métricas de áudio, 25 rótulos de gênero e 146 variáveis de Processamento de Linguagem Natural extraídas das letras das músicas. A análise inicial demonstrou que a combinação dos atributos textuais mais relevantes com as métricas de áudio resultou em um aumento significativo na pontuação F1-Macro dos modelos de classificação, em comparação com a utilização exclusiva das métricas de áudio, com a rede neural se destacando como o modelo de melhor desempenho. No entanto, esse aumento foi observado apenas quando a base foi filtrada para incluir os cinco gêneros nacionais mais populares. Esse resultado pode ser atribuído ao desbalanceamento entre gêneros e à presença reduzida de alguns gêneros na base de dados, o que pode ter limitado a capacidade dos modelos de aprender características distintas de gêneros menos representados
Estruturando o conhecimento jurídico: uma análise comparativa de sistemas de OpenIE aplicada ao domínio de inovação
Este trabalho investiga e compara o desempenho de diferentes gerações de sistemas de Extração Aberta de Informações na tarefa de estruturar o conhecimento contido no domínio legal brasileiro, com foco na legislação sobre inovação. A pesquisa aborda o desafio central imposto pela estrutura hierárquica e semanticamente fragmentada dos documentos legais, um obstáculo para ferramentas de Processamento de Linguagem Natural, propondo como contribuição metodológica o desenvolvimento de um pipeline de pré-processamento para a reconstrução de sentenças semanticamente coesas. Sobre um corpus representativo de 26 documentos legais, foram avaliadas três abordagens distintas: um modelo baseado em regras, outro em redes neurais junto a transformers e Modelos de Linguagem de Grande Escala (LLMs). Na ausência de um Gold Standard, a avaliação foi conduzida em duas etapas: uma análise preliminar diagnóstica, que confirmou a necessidade de tratamento dos resultados brutos, seguida por uma análise final sobre os resultados refinados através de uma etapa de pós-processamento. Essa etapa contou com a conversão das triplas extraídas em Grafos de Conhecimento, a aplicação de filtros linguísticos e agrupamento semântico. Os resultados demonstraram a superioridade dos LLMs, que geraram grafos de conhecimento com maior coesão e relevância semântica, identificando com mais eficácia os atores e conceitos do ecossistema de inovação. O estudo conclui que, com a metodologia adequada, é viável extrair conhecimento de textos legais complexos e que os avanços recentes em PLN resultam em uma estruturação de conhecimento significativamente mais robusta, oferecendo uma base sólida para futuras ferramentas de análise no direito brasileiro
Driver para visualização de dados RDF via SPARQL no Metabase
O crescimento exponencial dos dados conectados, que passaram de 95 para 1350 bases RDF (Resource Description Framework) entre 2009 e 2024, ocorreu em paralelo à democratização das ferramentas de BI (Business Intelligence). Contudo, a falta de conectores nativos nessas plataformas ainda mantém esses ecossistemas isolados. O trabalho desenvolve um driver SPARQL para o Metabase que conecta diretamente a endpoints SPARQL via HTTP (Hypertext Transfer Protocol) e HTTPS (Hypertext Transfer Protocol Secure),
executa consultas SPARQL dos tipos SELECT e ASK e expõe o grafo RDF no modelo tabular da ferramenta. O trabalho estabelece 12 critérios de aceitação e implementa a estratégia de tabela de propriedades particionada por classes para representar classes como tabelas e propriedades como colunas. O driver descobre metadados (classes e predicados mais frequentes), converte tipos XSD (XML Schema Definition) básicos para tipos nativos do Metabase e permite a parametrização com sintaxe de duplas chaves. A avaliação abrange oito endpoints SPARQL públicos, incluindo Wikidata, DBpedia e UniProt, com conectividade por HTTPS, incluindo cenários com certificado TLS (Transport Layer Security) inválido. Os testes confirmam a execução correta de SELECT e ASK e a criação de 8 visualizações (tabela, barras horizontais, barras verticais, rosca, linha, bolhas, número único e mapa) a partir de resultados tabulares. O projeto disponibiliza o dri
ver como artefato JAR (Java Archive) e imagem Docker e utiliza fluxo de integração contínua com verificações estáticas, testes unitários e empacotamento automatizado. Os resultados indicam viabilidade técnica e utilidade prática para explorar grafos RDF no Metabase, reduzindo as barreiras entre SPARQL e ferramentas de BI. As principais limitações concentram-se no suporte apenas aos tipos XSD básicos, na ausência de suporte a endpoints com autenticação e na exibição limitada às classes mais frequentes no query builder; trabalhos futuros podem ampliar a cobertura de tipos, adicionar autenticação e evoluir a conversão da consulta visual para SPARQL
- …
