AplikaceAplikace
Nastavení

Rozdíly

Zde můžete vidět rozdíly mezi vybranou verzí a aktuální verzí dané stránky.

Odkaz na výstup diff

Obě strany předchozí revizePředchozí verze
Následující verze
Předchozí verze
cnk:intercorp:historie [2024/10/01 10:29] – [Verze 16] alexandrrosencnk:intercorp:historie [2026/09/10 21:21] (aktuální) – [Verze 17ud] rosen
Řádek 1: Řádek 1:
 ===== Historie verzí ===== ===== Historie verzí =====
 +
 +==== Verze 17ud ====
 +
 +zveřejněná 9. 9. 2026 (pilotní verze)
 +
 +== Data: ==
 +
 +  * **nové knížky** v jádru: 40 českých přírůstků (celkem 1852), ve všech jazycích 214 přírůstků (celkem 6669), přehled viz [[https://jakobson.korpus.cz/~rosen/INTERCORP/ICv17ud/intercorp_core_inventory_prototype_v7.html|Průvodce jádrem Intercorpu]], viz též  [[https://jakobson.korpus.cz/~rosen/INTERCORP/ICv17ud/intercorp_hall_of_fame_v2_updated.html|Síň slávy]] všech, kdo se na rozšíření jádra ve verzi 17ud podíleli
 +  * nový jazyk: **kašubština** (kód ''cb'', zatím 2 knížky v jádru)
 +  * nový balíček textů: **[[https://www.ted.com|TED Talks]]** -- česky 1383 přepisů přednášek, tj. 2,4 milionu pozic, ve všech jazycích 39 374 přepisů, tj. 28,9 milionů pozic
 +  * přírůstky v balíčku **Project Syndicate** z let 2021--2025
 +  * **Bible** už je také ve španělštině a hornolužické srbštině
 +
 +== Anotace: ==
 +
 +  * tato verze je první, která je dostupná pouze s lingvistickou anotací podle Universal Dependencies
 +  * ve slovanských a románských jazycích nově anotujeme i složené slovesné tvary, viz poziční atribut ''cw_feats'' – **content-word features** ([[pojmy:content-word features|cw_feats]])
 +  * **autory** uvádíme v jádru nově také jménem, které je stejné ve všech jazycích (atribut textu ''rf_author''
 +  * poziční atributy využitelné k orientaci v syntaktické struktuře byly rozšířeny o odkazy na **tvar řídícího slova**: ''p_word'' (tvar rodiče) a ''e_word'' (tvar efektivního rodiče)
 +  * k lingvistické anotaci byly použity **novější jazykové modely** (ud-2.17), jen čínština bude v definitivní verzi 17ud anotována jiným způsobem (ale výsledek bude kompatibilní s Universal Dependencies)
 +  * k přípravě balíčku TED Talks jsme použili nové **nástroje na segmentaci a zarovnání** ([[https://github.com/thompsonb/vecalign|Vecalign]])
 +
 +== Vyhledávací rozhraní: ==
 +
 +  * v Pokročilém dotazu lze hodnotu pozičního atributu ''deprel'' (syntaktickou funkci slova)  zadávat podobně jako hodnoty atributů ''upos'' a ''feats'', tedy výběrem z nabídky funkce **Vložit tag** 
 +  * klikneme-li v konkordanci na libovolné slovo v jednom jazyce, zvýrazní se jeho nejpravděpodobnější **překladový ekvivalent** v druhém i dalším jazyce (tato funkce funguje i ve starších verzích InterCorpu) 
 +
 +== Opravené chyby: ==
 +
 +  * **jméno autora** nebylo uvedena u některých textů v rámci jednoho jazyka jednotně (atribut textu ''author'')
 +  * v jazycích psaných **cyrilicí** byly znaky graficky identické s latinkou někdy chybně kódovány jako latinka, většinu těchto chyb se nám podařilo odstranit 
 +
  
 ==== Verze 16ud ==== ==== Verze 16ud ====
Řádek 7: Řádek 39:
 == Data: == == Data: ==
   * obsahuje stejné texty jako verze 16   * obsahuje stejné texty jako verze 16
-  * lingvistická anotace +  * liší se hlavně v jednotné lingvistické anotaci všech jazyků podle standardu Universal Dependencies (viz verze 13ud
-  * stalo se to hlavně díky aktualizaci balíčku Subtitles, který teď obsahuje 4 001 mil. slov +  * u každé věty textu jsou nově jako metadata uvedeny také míry syntaktické komplexityu každého textu i míry lexikální diverzity 
-  * Subtitles a tím pádem i celém korpusu přibylo i 20 nových jazyků – korpus teď obsahuje celkem 62 jazyků (včetně češtiny+  * [[cnk:intercorp:verze16ud|Informace o korpusu]]
-  * počet slov cizojazyčných textech je celkem 4 893 mil., z toho 387 mil. jádro 4 506 mil. kolekce +
-  * počet slov v českých textech celkem je 398 mil.z toho 125 mil. jádro a 273 mil. kolekce +
-  * [[cnk:intercorp:verze16|Informace o korpusu]]+