Korpus SYN_R25

SYN_R25 je korpus zahrnující šest zveřejněných synchronních reprezentativních a referenčních korpusů současné psané češtiny řady SYN (SYN2000, SYN2005, SYN2010, SYN2015, SYN2020 a SYN2025), pokrývá časové období od roku 1989 do roku 2024. Korpus SYN_R25 je jednotně lemmatizovaný a morfologicky tagovaný, obsahuje syntaktické značkování a značkování víceslovných lexikálních jednotek, navíc je opatřen značkováním pojmenovaných entit a anotací složených slovesných tvarů.

Název SYN_R25
Pozice Počet pozic (tokenů) 713 716 351
Počet pozic bez interpunkce 585 195 666
Počet různých slovních tvarů (wordů) 4 404 849
Počet různých lemmat 2 275 065
Struktury Počet dokumentů <doc> 19 134
Počet textů <text> 836 245
Počet odstavců <p> 15 811 855
Počet vět <s> 44 928 686
Další informace Referenční ANO
Reprezentativní ANO (viz klasifikace textů)
Rok zveřejnění 2026

Složení korpusu SYN_R25

Reprezentativnost a vyváženost

Jednotlivé reprezentativní korpusy tvořící korpus SYN_R25 byly vytvářeny za odlišných podmínek. Korpusy vydané do roku 2010 včetně (SYN2000, SYN2005 a SYN2010) opíraly svoje složení o řadu průzkumů, které se pokoušely různými způsoby kvantifikovat recepci psaných textů běžnými čtenáři. Počínaje korpusem SYN2015 byla s revizí klasifikace textů přepracována i koncepce vyvažování korpusu. V těchto novějších korpusech (SYN2015, SYN2020, SYN2025) je namísto proporcí jednotlivých textových typů zohledňována jejich klasifikace a hierarchie: tři hlavní textové makrotypy – beletrie (FIC), oborová literatura (NFC) a publicistika (NMG) – jsou zastoupeny stejným dílem (tj. vždy jednou třetinou). Rezignuje se tím na vyváženost (proporce stanovené arbitrárně pro jednotlivé kategorie nemusí odpovídat jejich zastoupení v populaci), avšak při zachování reprezentativnosti (každý hlavní typ textu by měl být v korpusu zastoupen). Zároveň došlo ke zpětné reklasifikaci některých textů i v korpusech SYN2000, SYN2005 a SYN2010, takže i proto prostý součet počtu slov např. v beletrii ve všech šesti korpusech nedává celkovou velikost beletrie v SYN_R25. Jako důsledek reklasifikace a také z různých technických důvodů (z dnešního pohledu byla v dřívějších textech přílišná chybovost) byly některé texty vyřazeny. K menší rozdílům v počtu slov také dochází v důsledku změn v tokenizaci počínaje korpusem SYN2020.

Referenční korpusy psaného jazyka v pořadí podle doby vzniku
korpus velikost (počet slov) lemmatizace morfologické značky rok zveřejnění charakteristika korpusu
SYN2025 100 mil. 2025 reprezentativní korpus, převažují texty z let 2020–2024
SYN2020 100 mil. 2020 reprezentativní korpus, převažují texty z let 2015–2019
SYN2015 100 mil. 2015 reprezentativní korpus, převažují texty z let 2010–2014
SYN2010 100 mil. 2010 reprezentativní korpus, převažují texty z let 2005–2009
SYN2005 100 mil. 2005 reprezentativní korpus, převažují texty z let 2000–2004
SYN2000 100 mil. 2000 reprezentativní korpus, převažují texty z let 1990–1999

Klasifikace textů

Klasifikace textů v SYN_R25 je založena na externích, mimotextových kritériích a je hierarchická. Nejvyšší úroveň txtype_group určuje tři již zmíněné makrotypy textů: beletrii, oborovou literaturu a publicistiku, z nichž každý je zastoupen stejným dílem; další úroveň členění představuje txtype, vydělující např. v rámci beletrie prózu (romány vedle povídek), poezii a drama. Nejjemnější úroveň klasifikace textů pak představuje tzv. genre, jemuž je u textů oborové literatury (NFC) ještě nadřazena souhrnná kategorie genre_group – takto jsou třeba matematika (MAT), technika (TEC) a výpočetní technika (ICT) sloučeny jako jednotlivé disciplíny formálních a technických věd (FTS).

Podrobnosti o složení a klasifikaci najdete zde: přehledný souhrn jednotlivých kategorií včetně zkratek.

Složení korpusu SYN_R25 na základě textové klasifikace

Txtype_group Podíl
FIC: beletrie 29,56 %
NFC: oborová literatura 30,87 %
NMG: publicistika 39,57 %
txtype genre / genre_group kategorie proporce
Beletrie (FIC)
NOV próza 23,28 %
COL kratší próza 4,43 %
VER poezie 0,92 %
SCR drama 0,69 %
X ostatní beletrie 0,24 %
Oborová literatura (NFC)
SCI/PRO/POP HUM humanitní vědy 7,11 %
SSC sociální vědy 7,90 %
NAT přírodní vědy 5,54 %
FTS formální a technické vědy 5,39 %
ITD interdisciplinární 0,87 %
MEM memoáry, autobiografie 3,69 %
ADM administrativní texty 0,37 %
Publicistika (NMG)
NEW NTW celostátní publicistika – konkrétní tituly (MF, LN, HN, Právo) 16,27 %
NTW celostátní publicistika – ostatní 9,33 %
REG regionální publicistika 3,91 %
LEI volnočasová publicistika 10,06 %

Pojetí synchronie v jednotlivých reprezentativních korpusech

Vycházíme z předpokladu, že za synchronní lze považovat text, který se stále čte (resp. vydává), což v praxi indikuje rok vydání. Hranice synchronie se však u tří hlavních makroskupin liší:

Struktura korpusu SYN_R25 a strukturní značky

Hierarchie strukturních značek korpusu SYN_R25 je shodná se SYN2025: Nejvyšší strukturní jednotkou je ve shodě s mezinárodní konvencí dokument <doc>, který se skládá z jednoho nebo několika textů <text> (články v periodiku, kapitoly v knize nebo jiné smysluplné úseky). Texty se dále člení do odstavců <p> a vět <s>. Každá z těchto struktur je charakterizována konkrétními atributy, jejichž přehled uvádíme v následující tabulce.

<doc> Poznámka <text> Poznámka <p> Poznámka <s> Poznámka
title název dokumentu nebo periodika section generovaný typ rubriky (u vybraných periodik) id jednoznačný identifikátor id jednoznačný identifikátor
subtitle podtitul section_orig původní název rubriky (u vybraných periodik)
author autor dokumentu author autor článku (u vybraných periodik)
issue vydání (u periodik) id jednoznačný identifikátor
publisher vydavatel
pubplace místo vydání
pubyear rok vydání
first_published rok 1. vydání
translator překladatel
srclang zdrojový jazyk
authsex pohlaví autora
transsex pohlaví překladatele
txtype_group skupina textových typů
txtype textový typ
genre_group skupina oborů
genre tematická oblast
medium médium
periodicity periodicita
audience adresát
isbnissn ISBN/ISSN
biblio generovaný bibliografický údaj
id jednoznačný identifikátor
syn název jednoho ze šesti původních referenčních korpusů

Shoda struktury SYN_R25 se SYN2025 má pouze tuto výjimku: podobně jako v korpusech řady SYN přibyl i v korpusu SYN_R25 atribut <doc syn> pro vytváření subkorpusů odpovídajících původním referenčním korpusům.

Kromě výše uvedených hierarchických struktur jsou v korpusu zaznamenány také následující struktury:

Anotace SYN_R25

Morfologické značkování, lemmatizace a tokenizace korpusu SYN_R25 probíhá plně automaticky podle anotačního standardu ČNK, který byl aplikován již na korpus SYN2020. Tokenům jsou přiřazeny poziční atributy: lemma a sublemma, tag, verbtag, pos a case.
Kromě toho je korpus opatřen syntaktickým značkováním s řadou pozičních atributů přiřazených tokenům, např. parent, afun, p_tag (viz syntakticke_znacky), anotací víceslovných lexikálních jednotek, anotací pojmenovaných entit a značkováním složených slovesných tvarů.

Jak citovat SYN_r25

Křen, M. – Cvrček, V. – Čapka, T. – Hnátková, M. – Jelínek, T. – Kocek, J. – Kováříková, D. – Křivan, J. – Marklová, A. – Petkevič, V. – Skoumalová, H. – Škrabal, M.: SYN2025: reprezentativní korpus psané češtiny. Ústav Českého národního korpusu FF UK, Praha 2025. Dostupný z WWW: http://www.korpus.cz

Cvrček, V. – Čermáková, A. – Křen, M. (2016): Nová koncepce synchronních korpusů psané češtiny. Slovo a slovesnost, 77 (2), 83–101.

Jelínek, T. – Křivan, J. – Petkevič, V. – Skoumalová, H. – Šindlerová, J. (2021): SYN2020: A new corpus of Czech with an innovated annotation. In: K. Ekštein – F. Pártl – M. Konopík (eds.), Text, Speech, and Dialogue. TSD 2021. Lecture Notes in Computer Science, vol. 12848. Cham: Springer, 48–59.

Křivan, J. – Šindlerová, J. (2022): Změny v morfologické anotaci korpusů řady SYN: nové možnosti zkoumání české gramatiky a lexikonu. Slovo a slovesnost, 83 (2), 122–145.