1,721,103 research outputs found

    LLM-Based forecasting of scientific papers impact based on abstract

    Get PDF
    La dinàmica de la indústria editorial científica, especialment sota el model actual d'Accés Obert, ha provocat un debat considerable sobre les barreres econòmiques amb què es troben els autors. Tot i l'aparició de noves iniciatives editorials com les revistes Diamond Open Access, la participació dels autors i la percepció pública continuen sent baixes a causa de l'absència de la supervisió editorial tradicional, que proporciona un referent en termes de qualitat i impacte de la recerca. Aquest estudi explora el potencial d'aprofitar sistemes d'IA generativa com GPT-4o, emprant tècniques avançades de generació d'indicacions com a mecanisme alternatiu per predir l'impacte dels articles científics, a partir del seu resum, ja que és la part d'accés lliure dels treballs acadèmics. Mitjançant el disseny d'una àmplia varietat d'indicacions basades en les tècniques més recents d'enginyeria de prompts, l'estudi avalua la capacitat del model de llenguatge per classificar els articles de recerca en quartils de rellevància predeterminats, d'acord amb els rànquings acadèmics establerts per Scimago. Els primers assaigs mostren un èxit limitat, fet que suggereix que basar-se exclusivament en els resums pot ser insuficient per a una predicció precisa de l'impacte, i convida a una exploració més aprofundida.La dinámica de la industria editorial científica, especialmente bajo el modelo actual de Acceso Abierto, ha generado un debate considerable sobre las barreras económicas a las que se enfrentan los autores. A pesar de la aparición de nuevas iniciativas editoriales como las revistas Diamond Open Access, la participación de los autores y la percepción pública siguen siendo bajas debido a la ausencia de una supervisión editorial tradicional, que actúa como referencia para la calidad e impacto de la investigación. Este estudio explora el potencial de aprovechar sistemas de IA generativa como GPT-4o, utilizando técnicas avanzadas de creación de indicaciones (prompting) como un mecanismo alternativo para predecir el impacto de los artículos científicos, basándose en sus resúmenes, ya que constituyen la parte de acceso libre de los trabajos académicos. Mediante el diseño de una variedad diversa de indicaciones basadas en las técnicas más recientes de ingeniería de prompts, el estudio evalúa la capacidad del modelo de lenguaje para clasificar artículos de investigación en cuartiles de relevancia predeterminados, según los rankings académicos establecidos por Scimago. Los ensayos iniciales demuestran un éxito limitado, lo que sugiere que depender únicamente de los resúmenes puede no ser suficiente para una predicción precisa del impacto, lo que invita a una exploración más profunda.The dynamics of the scientific publishing industry, particularly under the current Open Access model, have incited substantial debate regarding the financial barriers faced by authors. Despite the availability of new publishing initiatives like Diamond Open Access journals, author engagement and public perception remains low due to the absence of traditional editorial oversight, which provides a benchmark for research quality and impact. This study explores the potential of leveraging Generative AI systems such as GPT-4o, specifically using advanced prompting techniques as an alternative mechanism to predict the impact of scientific articles, based on their abstract as it is the access-free part of scientific papers. By designing a diverse array of prompts based on the latest techniques of prompt engineering, the study evaluates the LLM's ability to categorize research articles into predetermined relevance quartiles, quartiles based on established academic rankings from Scimago. Initial trials demonstrate limited success, suggesting that reliance on abstracts alone may be insufficient for accurate impact forecasting, thus inviting further exploration

    Recerca accelerada de patrons en seqüències d'ADN

    Get PDF
    La bioinformàtica és una disciplina interdisciplinària que combina tècniques computacionals, estadístiques i d'anàlisiLa bioinformática es una disciplina interdisciplinaria que combina técnicas computacionales, estadísticas y de análisis de datos con el objetivo de estudiar y extraer conocimiento de los datos biológicos disponibles. Uno de los problemas clásicos en este campo es el conocido como site search problem, que consiste en buscar patrones específicos dentro de secuencias genómicas para identificar posiciones con posible significado biológico relevante. En este proyecto se estudia la implementación de métodos para acelerar este proceso de búsqueda, con el objetivo final de que puedan ser integrados en la biblioteca Biopython, un proyecto de código abierto que ofrece una gran variedad de herramientas útiles para la comunidad bioinformática.Bioinformatics is an interdisciplinary field that combines computational, statistical, and data analysis technique

    Estudi d'estratègies de codificació d'informació en DNA mitjançant algorismes evolutius

    No full text
    Aquest treball investiga l'ús d'algorismes de Qualitat-Diversitat (Q-D) per a l'estudi dels motius d'unió al DNA. L'objectiu és entendre la conservació i variabilitat de les seqüències de DNA mitjançant la mesura del contingut d'informació (IC) i el coeficient de Gini com a indicador de diversitat fenotípica. L'objectiu és trobar un conjunt de solucions òptimes amb fenotips diversos, aplicant una adaptació dels algorismes Qualitat-Diversitat per obtenir resultats de màxima qualitat en aquest espai fenotípic divers. Els resultats obtinguts mostren el comportament de l'algorisme en diferents situacions, així com la població resultant al finalitzar l'execució.Este trabajo investiga el uso de algoritmos de Calidad-Diversidad (Q-D) para el estudio de motivos de unión al ADN. El objetivo es comprender la conservación y variabilidad de las secuencias de ADN mediante la medición del contenido de información (IC) y el coeficiente de Gini como indicador de la diversidad fenotípica. La meta es encontrar un conjunto de soluciones óptimas con fenotipos diversos, aplicando una adaptación de los algoritmos de Calidad-Diversidad para obtener resultados de la más alta calidad en este espacio fenotípico diverso. Los resultados obtenidos muestran el comportamiento del algoritmo en diferentes situaciones, así como la población resultante al finalizar la ejecución.This work investigates the use of Quality-Diversity (Q-D) algorithms for studying DNA binding motifs. The aim is to understand the conservation and variability of DNA sequences by measuring information content (IC) and the Gini coefficient as an indicator of phenotypic diversity. The goal is to find a set of optimal solutions with diverse phenotypes by applying an adaptation of Quality-Diversity algorithms to achieve the highest quality results in this diverse phenotypic space. The obtained results demonstrate the algorithm's behavior in different situations, as well as the resulting population at the end of the execution

    Bioinformàtica : add-in d'anàlisi i manipulació de seqüències per Microsoft Word

    Get PDF
    L'objectiu del projecte consisteix en el desenvolupament d'un add-in d'anàlisi i manipulació de seqüències, senzill i de fàcil ús, integrable en l'entorn Microsoft Word per permetre la manipulació de seqüències genètiques directament des de Microsoft Word, estalviant temps, en evitar haver de canviar constantment de programa i format per treballar amb elles; i, també, complicacions a l'usuari final. L'add-in ha estat desenvolupat en Visual Basic + VSTO i ofereix diverses funcionalitats d'edició i anàlisi de seqüències, com ara el complement, la recerca de motius o l'alineament.El objetivo del proyecto consiste en el desarrollo de un add-in de análisis y manipulación de secuencias genéticas directamente desde Microsoft Word, ahorrando tiempo al evitar tener que cambiar constantemente de programa y formato para trabajar con ellas y, también, complicaciones al usuario final. El add-in ha sido desarrollado en Visual Basic + VSTO y ofrece diversas funcionalidades de edición y análisis de secuencias, como el complemento, la búsqueda de motivos o el alineamiento.The objective of this project is the development of an add-in for sequence analysis and manipulation, simple and easy to use and integrable within the Microsoft Word, saving time, by avoiding to constant program and format changes, and other nuisances to the final user. The add-in has been developed in Visual Basic + VSTO and offers diverse functionalities of sequence edition and analysis, such as the sequence complement, motif search or sequence alignment

    Going Beyond Counting First Authors in Author Co-citation Analysis

    Get PDF
    The present study examines one of the fundamental aspects of author co-citation analysis (ACA) - the way co-citation counts are defined. Co-citation counting provides the data on which all subsequent statistical analyses and mappings are based, and we compare ACA results based on two different types of co-citation counting - the traditional type that only counts the first one among a cited work's authors on the one hand and a non-traditional type that takes into account the first 5 authors of a cited work on the other hand. Results indicate that the picture produced through this non-traditional author co-citation counting contains more coherent author groups and is therefore considerably clearer. However, this picture represents fewer specialties in the research field being studied than that produced through the traditional first-author co-citation counting when the same number of top-ranked authors is selected and analyzed. Reasons for these effects are discussed

    Inferència de circuïts de control genètic en virus

    Get PDF
    Els bacteriòfags, o "fags", són virus que infecten bacteris i tenen el potencial de controlar les poblacions bacterianes, una característica crucial davant l'augment de les resistències bacterianes als antibiòtics. Malgrat això, els fags també poden codificar toxines perjudicials per als humans. Aquest projecte té com a objectiu desenvolupar un programa informàtic per identificar nous circuits de lisis-lisogènia en fags mitjançant el descobriment de motius. Utilitzant l'algoritme MEME per a la detecció de patrons en seqüències de nucleòtids.Los bacteriófagos, o "fagos", son virus que infectan bacterias y tienen el potencial de controlar a las poblaciones bacterianas, una característica crucial ante el aumento de las resistencias bacterianas a los antibióticos. Sin embargo, los fagos también pueden codificar toxinas perjudiciales para los humanos. Este proyecto tiene como objetivo desarrollar un programa informático para identificar nuevos circuitos de lisis-lisogenia en fagos mediante el descubrimiento de motivos. Utilizando el algoritmo MEME para la detección de patrones en secuencias de nucleótidos.Bacteriophages, or "phages", are viruses that infect bacteria and have the potential to control bacterial populations, a crucial feature in the face of increased bacterial resistance to antibiotics. However, phages can also encode toxins that are harmful to humans. This project aims to develop a computer program to identify new phage lysis lysogeny circuits by discovering motifs. Using the MEME algorithm for detecting patterns in nucleotide sequences

    Accelerated pattern search in DNA sequences

    Get PDF
    La bioinformàtica utilitza mètodes informàtics per operar amb moltes dades biològiques. Ens ajuda a entendre com funciona el DNA per crear i mantenir vius els éssers vius. Una tasca important és trobar patrons en seqüències de DNA que controlen els gens. Aquest mètode consisteix a analitzar grans conjunts de dades genòmiques i trobar posicions amb patrons. Aquest projecte vol accelerar el procés de recerca d'aquestes seqüències de genòmica mitjançant un enfocament look-ahead. Les millores s'afegiran a BioPython, un conjunt d'eines gratuïtes que ajuden a estudiar la computació biològica. El projecte contribueix a estudiar els programes genètics dins de les cèl·lules i accelerar el procés de recontrucció de xarxes de regulació amb presència genètica.La bioinformática utiliza métodos informáticos para operar con muchos datos biológicos. Nos ayuda a entender como funciona el DNA para crear y mantener vivos los seres vivos. Una tarea importante es encontrar patrones en secuencias de DNA que controlan los genes. Este método consiste en analizar grandes conjuntos de datos genómicos y encontrar posiciones con patrones. Este proyecto quiere acelerar el proceso de investigación de estas secuencias de genómica mediante un enfoque look-ahead. Las mejoras se añadirán a BioPython, un conjunto de herramientas gratuitas que ayudan a estudiar la computación biológica. El proyecto contribuye a estudiar los programas genéticos dentro de las células y acelerar el proceso de recontrucció de redes de regulación con presencia genética.Bioinformatics uses computer methods to handle large amounts of biological data. It helps us understand how DNA works to create and keep living beings alive. One important task is find instances of patterns in DNA sequences that control genes expression. This method consists on looking through large genomics datasets and identifying likely pattern positions. This project seeks to accelerate the process of finding these genomics sequences using heuristic approaches. The improvements will be added to BioPython, a set of free tools which helps studying biological sequence analysis. The project contributes to the inference of genetic programs within cells and to accelerate the process of reconstructing transcriptional regulatory networks

    Análisis de redes de regulación transcripcional con Maximización de la Expectación

    Get PDF
    L'objectiu d'aquest projecte és millorar l'anàlisi de les xarxes de regulació transcripcional que es duu a terme amb la plataforma CGB, mitjançant un algorisme de Maximització de l'expectativa. A partir de factors de transcripció, CGB identifica gens regulats i l'objectiu és millorar aquesta identificació. Els resultats han estat mixtos, tot i que es van detectar errors, també es van obtenir resultats prometedors amb motius ajustats a l'espècie que s'analitza, incrementant així la quantitat de gens regulats identificats. És possible que després de millorar l'algorisme es pugui utilitzar per obtenir més informació sobre la regulació dels gens amb consistència.El objetivo de este Proyecto es mejorar el análisis de las redes de regulación transcripcional que se lleva a cabo con la plataforma CGB, mediante un algoritmo de Maximización de la expectación. A partir de factores de transcripción, CGB identifica genes regulados y el objetivo es mejorar esta identificación. Los resultados han sido mixtos, aunque se detectaron errores, también se obtuvieron resultados prometedores con motivos ajustados a la especie que se analiza, incrementando así la cantidad de genes regulados identificados. Es posible que tras mejorar el algoritmo se pueda utilizar para obtener más información sobre la regulación de los genes con consistencia.The objective of this project is to improve the analysis of transcriptional regulatory networks carried out with the CGB platform, using an Expectation Maximization (EM) algorithm. Based on transcription factors, CGB identifies regulated genes, and the goal is to improve this identification. The results have been mixed; although errors were detected, there were also promising outcomes with motifs adjusted to the analyzed species, increasing the number of identified regulated genes. It is possible that after improving the algorithm, it can be used consistently to obtain more information on gene regulation

    AI-based functional annotation of viral genomes

    Get PDF
    Aquest projecte posa a prova un mètode d'IA per a l'assignació funcional de genomes de bacteriòfags, intentant superar els problemes habituals derivats de l'extrema diversitat del DNA viral. Prenent idees d'estudis sobre l'ordre genètic conservat per sintènia i del Processament del Llenguatge Natural, es tracten els gens individuals com a "paraules" i el genoma sencer com una llarga "frase". Els gens s'etiqueten amb identificadors de grups ortòlegs PHROG perquè un model Skip-gram Word2Vec pugui llegir els genomes, capturant els veïnats locals mitjançant una finestra lliscant de tres gens i emmagatzemant les impressions en incrustacions de trenta-dues dimensions. Després, dues estratègies senzilles intenten predir la funció dels gens: una utilitza una xarxa neuronal amb transferència d'aprenentatge per predir etiquetes PHROG, i l'altra agrupa incrustacions similars mitjançant agrupació per llindar de distància cosinus de 0, 6. La precisió del classificador fins ara és modesta, gairebé proporcional a la mida del conjunt d'entrenament i limitant-se a la sintènia, però l'agrupació ha aconseguit reunir clarament famílies conegudes com les endonucleases HNH i les proteïnes de la càpside viral.Este proyecto pone a prueba un método de inteligencia artificial para la asignación funcional de genomas de bacteriófagos, intentando superar los problemas habituales que surgen debido a la extrema diversidad del ADN viral. Tomando ideas de estudios sobre el orden génico conservado por sintenia y del Procesamiento del Lenguaje Natural, tratamos los genes individuales como "palabras" y el genoma completo como una larga "frase". Los genes se etiquetan con identificadores de grupos ortólogos PHROG para que un modelo Skip-gram Word2Vec pueda leer los genomas, capturando vecindades locales mediante una ventana deslizante de tres genes y almacenando las impresiones en incrustaciones de treinta y dos dimensiones. Luego, dos estrategias sencillas intentan predecir la función de los genes: una utiliza una red neuronal con aprendizaje por transferencia para predecir etiquetas PHROG, y la otra agrupa incrustaciones similares mediante clustering con un umbral de distancia coseno de 0, 6. La precisión del clasificador hasta ahora es modesta, casi proporcional al tamaño del conjunto de entrenamiento y basada únicamente en la sintenia, aunque el agrupamiento logró reunir claramente familias conocidas como las endonucleasas HNH y las proteínas de la cápside viral.This project tests an AI method for functional assigment of bacteriophage genomes, trying to overcome the usual problems that arise from the extreme diversity of viral DNA. Borrowing ideas from studies of synteny-conserved gene order and from Natural Language Processing, we treat individual genes as "words" and the entire genome as one long "sentence". Genes are tagged with PHROG ortholog group IDs so that a Skip-gram Word2Vec model can read the genomes, capturing local neighborhoods in a sliding window of three genes and storing impressions in thirty-two-dimensional embeddings. Two simple follow-up strategies then guess gene function: one uses transfer-learning neural network to predict PHROG labels, the other groups similar embeddings by clustering at a threshold of 0.6 cosine distance. Classifier accuracy so far is modest, nearly matching the size of the training set and pausing on synteny alone, yet the clustering cleanly pulled together known families like HNH endonucleases and virion shell protein
    corecore