SYN_R25 je korpus zahrnující šest zveřejněných synchronních reprezentativních a referenčních korpusů současné psané češtiny řady SYN (SYN2000, SYN2005, SYN2010, SYN2015, SYN2020 a SYN2025), pokrývá časové období od roku 1989 do roku 2024. Korpus SYN_R25 je jednotně lemmatizovaný a morfologicky tagovaný, obsahuje syntaktické značkování a značkování víceslovných lexikálních jednotek, navíc je opatřen značkováním pojmenovaných entit a anotací složených slovesných tvarů.
| Název | SYN_R25 | |
|---|---|---|
| Pozice | Počet pozic (tokenů) | 713 716 351 |
| Počet pozic bez interpunkce | 585 195 666 | |
| Počet různých slovních tvarů (wordů) | 4 404 849 | |
| Počet různých lemmat | 2 275 065 | |
| Struktury | Počet dokumentů <doc> | 19 134 |
| Počet textů <text> | 836 245 | |
| Počet odstavců <p> | 15 811 855 | |
| Počet vět <s> | 44 928 686 | |
| Další informace | Referenční | ANO |
| Reprezentativní | ANO (viz klasifikace textů) | |
| Rok zveřejnění | 2026 | |
Jednotlivé reprezentativní korpusy tvořící korpus SYN_R25 byly vytvářeny za odlišných podmínek. Korpusy vydané do roku 2010 včetně (SYN2000, SYN2005 a SYN2010) opíraly svoje složení o řadu průzkumů, které se pokoušely různými způsoby kvantifikovat recepci psaných textů běžnými čtenáři. Počínaje korpusem SYN2015 byla s revizí klasifikace textů přepracována i koncepce vyvažování korpusu. V těchto novějších korpusech (SYN2015, SYN2020, SYN2025) je namísto proporcí jednotlivých textových typů zohledňována jejich klasifikace a hierarchie: tři hlavní textové makrotypy – beletrie (FIC), oborová literatura (NFC) a publicistika (NMG) – jsou zastoupeny stejným dílem (tj. vždy jednou třetinou). Rezignuje se tím na vyváženost (proporce stanovené arbitrárně pro jednotlivé kategorie nemusí odpovídat jejich zastoupení v populaci), avšak při zachování reprezentativnosti (každý hlavní typ textu by měl být v korpusu zastoupen). Zároveň došlo ke zpětné reklasifikaci některých textů i v korpusech SYN2000, SYN2005 a SYN2010, takže i proto prostý součet počtu slov např. v beletrii ve všech šesti korpusech nedává celkovou velikost beletrie v SYN_R25. Jako důsledek reklasifikace a také z různých technických důvodů (z dnešního pohledu byla v dřívějších textech přílišná chybovost) byly některé texty vyřazeny. K menší rozdílům v počtu slov také dochází v důsledku změn v tokenizaci počínaje korpusem SYN2020.
| Referenční korpusy psaného jazyka v pořadí podle doby vzniku | |||||
|---|---|---|---|---|---|
| korpus | velikost (počet slov) | lemmatizace | morfologické značky | rok zveřejnění | charakteristika korpusu |
| SYN2025 | 100 mil. | ✓ | ✓ | 2025 | reprezentativní korpus, převažují texty z let 2020–2024 |
| SYN2020 | 100 mil. | ✓ | ✓ | 2020 | reprezentativní korpus, převažují texty z let 2015–2019 |
| SYN2015 | 100 mil. | ✓ | ✓ | 2015 | reprezentativní korpus, převažují texty z let 2010–2014 |
| SYN2010 | 100 mil. | ✓ | ✓ | 2010 | reprezentativní korpus, převažují texty z let 2005–2009 |
| SYN2005 | 100 mil. | ✓ | ✓ | 2005 | reprezentativní korpus, převažují texty z let 2000–2004 |
| SYN2000 | 100 mil. | ✓ | ✓ | 2000 | reprezentativní korpus, převažují texty z let 1990–1999 |
Klasifikace textů v SYN_R25 je založena na externích, mimotextových kritériích a je hierarchická. Nejvyšší úroveň txtype_group určuje tři již zmíněné makrotypy textů: beletrii, oborovou literaturu a publicistiku, z nichž každý je zastoupen stejným dílem; další úroveň členění představuje txtype, vydělující např. v rámci beletrie prózu (romány vedle povídek), poezii a drama. Nejjemnější úroveň klasifikace textů pak představuje tzv. genre, jemuž je u textů oborové literatury (NFC) ještě nadřazena souhrnná kategorie genre_group – takto jsou třeba matematika (MAT), technika (TEC) a výpočetní technika (ICT) sloučeny jako jednotlivé disciplíny formálních a technických věd (FTS).
Podrobnosti o složení a klasifikaci najdete zde: přehledný souhrn jednotlivých kategorií včetně zkratek.
| Txtype_group | Podíl |
|---|---|
| FIC: beletrie | 29,56 % |
| NFC: oborová literatura | 30,87 % |
| NMG: publicistika | 39,57 % |
| txtype | genre / genre_group | kategorie | proporce |
|---|---|---|---|
| Beletrie (FIC) | |||
| NOV | próza | 23,28 % | |
| COL | kratší próza | 4,43 % | |
| VER | poezie | 0,92 % | |
| SCR | drama | 0,69 % | |
| X | ostatní beletrie | 0,24 % | |
| Oborová literatura (NFC) | |||
| SCI/PRO/POP | HUM | humanitní vědy | 7,11 % |
| SSC | sociální vědy | 7,90 % | |
| NAT | přírodní vědy | 5,54 % | |
| FTS | formální a technické vědy | 5,39 % | |
| ITD | interdisciplinární | 0,87 % | |
| MEM | memoáry, autobiografie | 3,69 % | |
| ADM | administrativní texty | 0,37 % | |
| Publicistika (NMG) | |||
| NEW | NTW | celostátní publicistika – konkrétní tituly (MF, LN, HN, Právo) | 16,27 % |
| NTW | celostátní publicistika – ostatní | 9,33 % | |
| REG | regionální publicistika | 3,91 % | |
| LEI | volnočasová publicistika | 10,06 % | |
Vycházíme z předpokladu, že za synchronní lze považovat text, který se stále čte (resp. vydává), což v praxi indikuje rok vydání. Hranice synchronie se však u tří hlavních makroskupin liší:
Hierarchie strukturních značek korpusu SYN_R25 je shodná se SYN2025: Nejvyšší strukturní jednotkou je ve shodě s mezinárodní konvencí dokument <doc>, který se skládá z jednoho nebo několika textů <text> (články v periodiku, kapitoly v knize nebo jiné smysluplné úseky). Texty se dále člení do odstavců <p> a vět <s>. Každá z těchto struktur je charakterizována konkrétními atributy, jejichž přehled uvádíme v následující tabulce.
<doc> | Poznámka | <text> | Poznámka | <p> | Poznámka | <s> | Poznámka |
|---|---|---|---|---|---|---|---|
| title | název dokumentu nebo periodika | section | generovaný typ rubriky (u vybraných periodik) | id | jednoznačný identifikátor | id | jednoznačný identifikátor |
| subtitle | podtitul | section_orig | původní název rubriky (u vybraných periodik) | ||||
| author | autor dokumentu | author | autor článku (u vybraných periodik) | ||||
| issue | vydání (u periodik) | id | jednoznačný identifikátor | ||||
| publisher | vydavatel | ||||||
| pubplace | místo vydání | ||||||
| pubyear | rok vydání | ||||||
| first_published | rok 1. vydání | ||||||
| translator | překladatel | ||||||
| srclang | zdrojový jazyk | ||||||
| authsex | pohlaví autora | ||||||
| transsex | pohlaví překladatele | ||||||
| txtype_group | skupina textových typů | ||||||
| txtype | textový typ | ||||||
| genre_group | skupina oborů | ||||||
| genre | tematická oblast | ||||||
| medium | médium | ||||||
| periodicity | periodicita | ||||||
| audience | adresát | ||||||
| isbnissn | ISBN/ISSN | ||||||
| biblio | generovaný bibliografický údaj | ||||||
| id | jednoznačný identifikátor | ||||||
| syn | název jednoho ze šesti původních referenčních korpusů |
Shoda struktury SYN_R25 se SYN2025 má pouze tuto výjimku: podobně jako v korpusech řady SYN přibyl i v korpusu SYN_R25 atribut <doc syn> pro vytváření subkorpusů odpovídajících původním referenčním korpusům.
Kromě výše uvedených hierarchických struktur jsou v korpusu zaznamenány také následující struktury:
<hi>: zvýraznění a řezy písma (pouze tam, kde byly zachyceny ve vstupním formátu);<lb>: označení hranice verše v poezii;<ne>: označení pojmenovaných entit;<note>: označení poznámek pod čarou (pouze tam, kde byly zachyceny ve vstupním formátu);<table/> místo, kde byla v původním textu tabulka (nepárová struktura);<ref/> místo, kde byl v původním textu webový odkaz (nepárová struktura);<email/> místo, kde byla v původním textu e-mailová adresa (nepárová struktura);<graphic/> místo, kde byl v původním textu grafický symbol, rovnice apod. (nepárová struktura);<geo/> místo, kde byly v původním textu GPS souřadnice (nepárová struktura)<g/> místo, kde mezi dvěma po sobě následujícími tokeny nebyla v textu mezera (nepárová struktura), např. „70<g/>. léta“.
Morfologické značkování, lemmatizace a tokenizace korpusu SYN_R25 probíhá plně automaticky podle anotačního standardu ČNK, který byl aplikován již na korpus SYN2020. Tokenům jsou přiřazeny poziční atributy: lemma a sublemma, tag, verbtag, pos a case.
Kromě toho je korpus opatřen syntaktickým značkováním s řadou pozičních atributů přiřazených tokenům, např. parent, afun, p_tag (viz syntakticke_znacky), anotací víceslovných lexikálních jednotek, anotací pojmenovaných entit a značkováním složených slovesných tvarů.
Křen, M. – Cvrček, V. – Čapka, T. – Hnátková, M. – Jelínek, T. – Kocek, J. – Kováříková, D. – Křivan, J. – Marklová, A. – Petkevič, V. – Skoumalová, H. – Škrabal, M.: SYN2025: reprezentativní korpus psané češtiny. Ústav Českého národního korpusu FF UK, Praha 2025. Dostupný z WWW: http://www.korpus.cz
Cvrček, V. – Čermáková, A. – Křen, M. (2016): Nová koncepce synchronních korpusů psané češtiny. Slovo a slovesnost, 77 (2), 83–101.
Jelínek, T. – Křivan, J. – Petkevič, V. – Skoumalová, H. – Šindlerová, J. (2021): SYN2020: A new corpus of Czech with an innovated annotation. In: K. Ekštein – F. Pártl – M. Konopík (eds.), Text, Speech, and Dialogue. TSD 2021. Lecture Notes in Computer Science, vol. 12848. Cham: Springer, 48–59.
Křivan, J. – Šindlerová, J. (2022): Změny v morfologické anotaci korpusů řady SYN: nové možnosti zkoumání české gramatiky a lexikonu. Slovo a slovesnost, 83 (2), 122–145.