CLARIN-PL
Not a member yet
504 research outputs found
Sort by
Terminology in WordNet and in plWordNet
We examine the strategies of organizing terminological information in WordNet, and describe an analogous strategy of adding terminological senses of lexical units to plWordNet, a large Polish wordnet. Wordnet builders must cope with differences in lexical and terminological definitions of a term, and with the boundaries between terminological and lexical information. A somewhat adjusted strategy is required for Polish, though both WordNet and plWordNet rely mainly on semantic relations in organizing the terminological and general-language units. The proposed guidelines for plWordNet, built on several distinct combinations of denotation and connotation, have a solid theoretical underpinning but will require a large-scale verification of their effectiveness in practice
KPWr-lemma
KPWr (Polish Corpus of Wrocław University of Technology, pl. Korpus Języka Polskiego Politechniki Wrocławskiej) is a corpus of written and spoken documents available on the Creative Common license. The texts are divided into 14 categories (blogs, science, stenographic recordings, etc.). The documents are annotated on the level of chunks and selected predicate-argument relations, named entities, relations between named entities, anaphora relations and word senses
WCRFT2
WCRFT is a morphosyntactic tagger for Polish. The tagger brings together Conditional Random Fields (CRF) and tiered tagging of plain tekst
NELexicon2
NELexicon2 to rozszerzona wersją gazetteera nazw własnych, która zawiera ponad 2,3 miliona unikalnych napisów. NELexicon został wzmogacony o następujące zasoby:
- zdrobnienia imion,
- obcojęzyczne formy polskich imion,
- nazwy wyciągnięte z infoboxów polskiej Wikipedii,
- formy odmiany nazw z infoboxów polskiej Wikipedii wyciągnięte z linków wewnętrznych Wikipedii,
- lista nazw rozpoznanych przez Liner2 z modelem 56 nam o liczbie wystąpień równej lub większej niż 5. Jako, że nazwy zostały rozpoznane automatycznie, to lista może zawierać błędnie rozpoznane nazwy.
- formy odmiany nazw wyciągnięte z polskiego Wikisłownika
Korpus Języka Polskiego Politechniki Wrocławskiej (KPWr) 1.1
KPWr (Polish Corpus of Wrocław University of Technology, pl. Korpus Języka Polskiego Politechniki Wrocławskiej) is a corpus of written and spoken documents available on the Creative Common license. The texts are divided into 14 categories (blogs, science, stenographic recordings, etc.). The documents are annotated on the level of chunks and selected predicate-argument relations, named entities, relations between named entities, anaphora relations and word senses
RL-Button
W kontekście rzutowania leksykalnych sieci semantycznych, idea algorytmu Relaxation Labeling (RL) zaproponowanego przez autorów w [1], polega na określaniu wag potencjalnych powiązań pomiędzy parą synsetów, uwzględniając zadane wcześniej ograniczenia. Waga takiego powiązania jest odpowiednio modyfikowana: może być zwiększana bądź zmniejszana, jednak suma wag dla potencjalnych odpowiedników danego sysnetu zawsze musi wynosić 1. Podstawowa wersja agorytmu została rozszerzona o dodatkowe źródło informacji, nazwane niepodważalnymi powiązaniami. Algorytm uwzględnia wprowadzone ręcznie powiązania, traktując je jako powiązania, które nie mogą być zmodyfikowane
Pytania i odpowiedzi z serwisu wikipedyjnego "Czy wiesz", wersja 2.0
Zbiór wzbogacono o oznaczenie konkretnych fragmentów zawierających odpowiedź na wskazane pytania.
Wszystkie wskazane fragmenty zostały zweryfikowane przez człowieka. Niektórym pytaniom przypisano wiele fragmentów.
Celem zbioru jest testowanie i rozwój systemów typu Question Answering dla języka polskiego.
Liczymy na to, że dzięki udostępnieniu zarówno pytań, jak i całej kolekcji testowej (całej Wikipedii z wybranego zrzutu), możliwe będzie przeprowadzenie różnych eksperymentów w tych samych warunkach, dzięki czemu wyniki będą ze sobą bezpośrednio porównywalne.
Zbiór udostępniany jest na licencji Creative Commons Uznanie Autorstwa, na tych samych warunkach 3.0 (CC-BY-SA 3.0)