AplikaceAplikace
Nastavení

Rozdíly

Zde můžete vidět rozdíly mezi vybranou verzí a aktuální verzí dané stránky.

Odkaz na výstup diff

Obě strany předchozí revizePředchozí verze
Následující verzeObě strany příští revize
kurz:hledani_v_paralelnim_korpusu [2021/04/19 14:35] – [Specifika vyhledávání v paralelním korpusu] michalskrabalkurz:hledani_v_paralelnim_korpusu [2022/08/13 13:26] – [Specifika korpusů řady InterCorp] alexandrrosen
Řádek 47: Řádek 47:
  
   * Ne každý jazyk v korpusu InterCorp je [[pojmy:lemma|lemmatizovaný]] nebo [[pojmy:tag|tagovaný]], tj. morfologicky označkovaný (např. u nizozemštiny či maďarštiny chybí ve verzi 9 lemmatizace), viz [[cnk:intercorp:verze9#Morfosyntaktická anotace|seznam]].   * Ne každý jazyk v korpusu InterCorp je [[pojmy:lemma|lemmatizovaný]] nebo [[pojmy:tag|tagovaný]], tj. morfologicky označkovaný (např. u nizozemštiny či maďarštiny chybí ve verzi 9 lemmatizace), viz [[cnk:intercorp:verze9#Morfosyntaktická anotace|seznam]].
-  * Způsob tagování je pro různé jazyky odlišný -- může se lišit repertoárem a obsahem morfologických kategorií i způsobem jejich zápisu.+  * Způsob tagování je pro různé jazyky odlišný -- může se lišit repertoárem a obsahem morfologických kategorií i způsobem jejich zápisu. Výjimkou je verze [[cnk:intercorp:verze13ud|13ud]], která je anotována morfologicky i syntakticky podle zásad mezinárodního projektu [[pojmy:ud|Universal Dependencies]], které jsou pro všechny jazyky jednotné.
   * Korpusy jednotlivých jazyků se výrazně liší co do složení textových typů i žánrů, většinou tedy nejsou mezi sebou snadno srovnatelné.   * Korpusy jednotlivých jazyků se výrazně liší co do složení textových typů i žánrů, většinou tedy nejsou mezi sebou snadno srovnatelné.
   * Velikost korpusu nekoreluje s počtem mluvčích daného jazyka (s jeho „velikostí“), je dána dostupností textů a aktivitou koordinačního týmu pro daný jazyk.   * Velikost korpusu nekoreluje s počtem mluvčích daného jazyka (s jeho „velikostí“), je dána dostupností textů a aktivitou koordinačního týmu pro daný jazyk.