82129 research outputs found
Sort by
HunSimpleNews: az első autentikus magyar nyelvű szövegekből álló szövegegyszerűsítési korpusz
A tanulmány az első autentikus magyar nyelvű szövegekből álló szövegegyszerűsítési korpuszt mutatja be. A korpusz 2832 darab könnyen érthető (egyszerűsített) és standard nyelvi szövegpárból áll, melyet a PannonRTV honlapjáról gyűjtöttünk. A tanulmányban bemutatjuk a korpusz összeállításának és minőségellenőrzésének folyamatát, kitérünk a korpusz két domainje közötti kvantitatív különbségekre és hasonlóságokra, végül a korpusz alapján felmérjük az általunk elérhető, magyarul tudó nagy nyelvmodellek szövegegyszerűsítési képességét incontext tanítási környezetben. Cikkünkben kimutatjuk, hogy az egyszerűsített szövegek és a standard nyelvi szövegek között lényeges különbségek vannak, mind az általuk használt szavak varianciájában, mind pedig a mondatok hosszában. Eredményeinkből láthatóvá válik, hogy a korpusz használata one-shot és few-shot tanítási környezetben is javítja a modellek egyszerűsített kimenetét a zero-shot eredményeinkhez képest
A méret a lényeg? Morfológiailag annotált korpuszok összehasonlító kiértékelése
A korpuszok egyik legjellemzőbb tulajdonsága a méretük, második szempontként pedig az annotációk minőségét szokás említeni. Minőség alatt elsősorban konzisztenciát értünk: azt mérjük, hogyan teljesít a korpusz egy részén betanított modell a korpusz egy másik részén. Cikkünkben különböző méretű morfológiailag annotált korpuszokon (ELTE DH gold standard korpusz, NYTK-NerKor, Szeged Treebank) vizsgáltuk, hogy mekkora az elég nagy korpusz. Mivel a vizsgált korpuszok standard címkekészleteket követnek, kézenfekvőnek tűnt a kombinálásukkal is kísérletezni, így ugyanis a nagyobb méret mellett nagyobb műfaji változatosságot is elérhetünk. Eredményeink szerint nem a korpuszok mérete a volt döntő szempont a teljesítményben, a különböző korpuszok vegyítése pedig még rontott is az eredményeken az annotációs sémák eltérő értelmezései miatt