AplikaceAplikace
Nastavení

Rozdíly

Zde můžete vidět rozdíly mezi vybranou verzí a aktuální verzí dané stránky.

Odkaz na výstup diff

Obě strany předchozí revizePředchozí verze
Následující verze
Předchozí verze
cnk:intercorp:historie [2026/09/10 10:51] – [Verze 17ud] rosencnk:intercorp:historie [2026/09/10 21:21] (aktuální) – [Verze 17ud] rosen
Řádek 3: Řádek 3:
 ==== Verze 17ud ==== ==== Verze 17ud ====
  
-zveřejněná 4. 9. 2026+zveřejněná 9. 9. 2026 (pilotní verze)
  
 == Data: == == Data: ==
  
-  * **nové knížky** v jádru: 40 českých (celkem 1852), ve všech jazycích 214 (celkem 6669)+  * **nové knížky** v jádru: 40 českých přírůstků (celkem 1852), ve všech jazycích 214 přírůstků (celkem 6669), přehled viz [[https://jakobson.korpus.cz/~rosen/INTERCORP/ICv17ud/intercorp_core_inventory_prototype_v7.html|Průvodce jádrem Intercorpu]], viz též  [[https://jakobson.korpus.cz/~rosen/INTERCORP/ICv17ud/intercorp_hall_of_fame_v2_updated.html|Síň slávy]] všech, kdo se na rozšíření jádra ve verzi 17ud podíleli
   * nový jazyk: **kašubština** (kód ''cb'', zatím 2 knížky v jádru)   * nový jazyk: **kašubština** (kód ''cb'', zatím 2 knížky v jádru)
   * nový balíček textů: **[[https://www.ted.com|TED Talks]]** -- česky 1383 přepisů přednášek, tj. 2,4 milionu pozic, ve všech jazycích 39 374 přepisů, tj. 28,9 milionů pozic   * nový balíček textů: **[[https://www.ted.com|TED Talks]]** -- česky 1383 přepisů přednášek, tj. 2,4 milionu pozic, ve všech jazycích 39 374 přepisů, tj. 28,9 milionů pozic
Řádek 16: Řádek 16:
  
   * tato verze je první, která je dostupná pouze s lingvistickou anotací podle Universal Dependencies   * tato verze je první, která je dostupná pouze s lingvistickou anotací podle Universal Dependencies
-  * ve slovanských a románských jazycích nově uvádíme také morfologické kategoriekteré u analytických (perifrastických) slovesných tvarů zohledňují i pomocná slovesa; tyto kategorie obsahuje u významových (autosémantických) sloves poziční atribut ''cw_feats'' – **content-word features** (viz [[pojmy:content-word features|cw_feats]]); podobnou roli hraje v novějších českých korpusech atribut [[pojmy:verbtag|verbtag]]+  * ve slovanských a románských jazycích nově anotujeme i složené slovesné tvaryviz poziční atribut ''cw_feats'' – **content-word features** ([[pojmy:content-word features|cw_feats]])
   * **autory** uvádíme v jádru nově také jménem, které je stejné ve všech jazycích (atribut textu ''rf_author''   * **autory** uvádíme v jádru nově také jménem, které je stejné ve všech jazycích (atribut textu ''rf_author''
   * poziční atributy využitelné k orientaci v syntaktické struktuře byly rozšířeny o odkazy na **tvar řídícího slova**: ''p_word'' (tvar rodiče) a ''e_word'' (tvar efektivního rodiče)   * poziční atributy využitelné k orientaci v syntaktické struktuře byly rozšířeny o odkazy na **tvar řídícího slova**: ''p_word'' (tvar rodiče) a ''e_word'' (tvar efektivního rodiče)