~~NOTOC~~ ====== Korpus SYN_R25 ====== SYN_R25 je korpus zahrnující šest zveřejněných [[pojmy:synchronni|synchronních]] [[pojmy:reprezentativnost|reprezentativních]] a [[pojmy:referencni#referencni_korpus_jako_nemenna_entita|referenčních]] korpusů současné [[pojmy:psany|psané]] češtiny [[cnk:syn|řady SYN]] ([[cnk:syn2000|SYN2000]], [[cnk:syn2005|SYN2005]], [[cnk:syn2010|SYN2010]], [[cnk:syn2015|SYN2015]], [[cnk:syn2020|SYN2020]] a [[cnk:syn2025|SYN2025]]), pokrývá časové období od roku 1989 do roku 2024. Korpus SYN_R25 je jednotně [[pojmy:lemma|lemmatizovaný]] a morfologicky [[pojmy:tag|tagovaný]], obsahuje [[pojmy:syntakticka_analyza|syntaktické značkování]] a [[seznamy:mwe|značkování víceslovných lexikálních jednotek]], navíc je opatřen [[seznamy:named_entities|značkováním pojmenovaných entit]] a [[seznamy:verbform|anotací složených slovesných tvarů]]. ^ Název ^^ SYN_R25 ^ ^ [[pojmy:atributy_pozicni|Pozice]] ^ Počet [[pojmy:token|pozic (tokenů)]] | 713 716 351 | ^ ::: ^ Počet pozic bez interpunkce | 585 195 666 | ^ ::: ^ Počet různých [[pojmy:word|slovních tvarů (wordů)]] | 4 404 849 | ^ ::: ^ Počet různých [[pojmy:lemma|lemmat]] | 2 275 065 | ^ [[pojmy:atributy_strukturni|Struktury]] ^ Počet [[pojmy:doc|dokumentů]] | 19 134 | ^ ::: ^ Počet [[seznamy:strukturni_atributy_syn|textů]] | 836 245 | ^ ::: ^ Počet odstavců

| 15 811 855 | ^ ::: ^ Počet vět | 44 928 686 | ^ Další informace ^ [[pojmy:referencni|Referenční]] | ANO | ^ ::: ^ [[pojmy:reprezentativnost|Reprezentativní]] | ANO (viz [[cnk:klasifikace_textu_syn2015|klasifikace textů]]) | ^ ::: ^ Rok zveřejnění | 2026 | ====== Složení korpusu SYN_R25 ====== ==== Reprezentativnost a vyváženost ==== Jednotlivé reprezentativní korpusy tvořící korpus SYN_R25 byly vytvářeny za odlišných podmínek. Korpusy vydané do roku 2010 včetně (SYN2000, SYN2005 a SYN2010) opíraly svoje složení o řadu průzkumů, které se pokoušely různými způsoby kvantifikovat recepci psaných textů běžnými čtenáři. Počínaje korpusem SYN2015 byla s revizí [[cnk:syn_r25#klasifikace_textu|klasifikace textů]] přepracována i koncepce vyvažování korpusu. V těchto novějších korpusech (SYN2015, SYN2020, SYN2025) je namísto proporcí jednotlivých textových typů zohledňována jejich klasifikace a hierarchie: tři hlavní [[pojmy:txtype_group|textové makrotypy]] – beletrie (FIC), oborová literatura (NFC) a publicistika (NMG) – jsou zastoupeny stejným dílem (tj. vždy jednou třetinou). Rezignuje se tím na vyváženost (proporce stanovené arbitrárně pro jednotlivé kategorie nemusí odpovídat jejich zastoupení v populaci), avšak při zachování reprezentativnosti (každý hlavní typ textu by měl být v korpusu zastoupen). Zároveň došlo ke zpětné reklasifikaci některých textů i v korpusech SYN2000, SYN2005 a SYN2010, takže i proto prostý součet počtu slov např. v beletrii ve všech šesti korpusech nedává celkovou velikost beletrie v SYN_R25. Jako důsledek reklasifikace a také z různých technických důvodů (z dnešního pohledu byla v dřívějších textech přílišná chybovost) byly některé texty vyřazeny. K menší rozdílům v počtu slov také dochází v důsledku změn v [[cnk:syn2020#tokenizace|tokenizaci]] počínaje korpusem SYN2020. ^ Referenční korpusy psaného jazyka v pořadí podle doby vzniku ^^^^^^ ^ korpus ^ velikost (počet slov) ^ [[pojmy:lemma|lemmatizace]] ^ [[pojmy:tag|morfologické značky]] ^ rok zveřejnění ^ charakteristika korpusu ^ ^ [[cnk:syn2025|SYN2025]] | 100 mil. | ✓ | ✓ | 2025 | reprezentativní korpus, převažují texty z let 2020–2024| ^ [[cnk:syn2020|SYN2020]] | 100 mil. | ✓ | ✓ | 2020 | reprezentativní korpus, převažují texty z let 2015–2019| ^ [[cnk:syn2015|SYN2015]] | 100 mil. | ✓ | ✓ | 2015 | reprezentativní korpus, převažují texty z let 2010–2014| ^ [[cnk:syn2010|SYN2010]] | 100 mil. | ✓ | ✓ | 2010 | reprezentativní korpus, převažují texty z let 2005–2009| ^ [[cnk:syn2005|SYN2005]] | 100 mil. | ✓ | ✓ | 2005 | reprezentativní korpus, převažují texty z let 2000–2004| ^ [[cnk:syn2000|SYN2000]] | 100 mil. | ✓ | ✓ | 2000 | reprezentativní korpus, převažují texty z let 1990–1999| ==== Klasifikace textů ==== Klasifikace textů v SYN_R25 je založena na externích, mimotextových kritériích a je hierarchická. Nejvyšší úroveň ''[[pojmy:txtype_group|txtype_group]]'' určuje tři již zmíněné makrotypy textů: beletrii, oborovou literaturu a publicistiku, z nichž každý je zastoupen stejným dílem; další úroveň členění představuje ''[[pojmy:txtype|txtype]]'', vydělující např. v rámci beletrie prózu (romány vedle povídek), poezii a drama. Nejjemnější úroveň klasifikace textů pak představuje tzv. ''[[pojmy:genre|genre]]'', jemuž je u textů oborové literatury (NFC) ještě nadřazena souhrnná kategorie ''[[pojmy:genre_group|genre_group]]'' -- takto jsou třeba matematika (MAT), technika (TEC) a výpočetní technika (ICT) sloučeny jako jednotlivé disciplíny formálních a technických věd (FTS). Podrobnosti o složení a klasifikaci najdete zde: [[cnk:klasifikace_textu_syn2015|přehledný souhrn jednotlivých kategorií včetně zkratek]]. ==== Složení korpusu SYN_R25 na základě textové klasifikace ==== ^ Txtype_group ^ Podíl ^ | FIC: beletrie | 29,56 % | | NFC: oborová literatura | 30,87 % | | NMG: publicistika | 39,57 % | ^ txtype ^ genre / genre_group ^ kategorie ^ proporce ^ | **Beletrie** (FIC) |||| | NOV | | próza | 23,28 % | | COL | | kratší próza | 4,43 % | | VER | | poezie | 0,92 % | | SCR | | drama | 0,69 % | | X | | ostatní beletrie | 0,24 % | | **Oborová literatura** (NFC) |||| | SCI/PRO/POP | HUM | humanitní vědy | 7,11 % | | ::: | SSC | sociální vědy | 7,90 % | | ::: | NAT | přírodní vědy | 5,54 % | | ::: | FTS | formální a technické vědy | 5,39 % | | ::: | ITD | interdisciplinární | 0,87 % | | MEM | | memoáry, autobiografie | 3,69 % | | ADM | | administrativní texty | 0,37 % | | **Publicistika** (NMG) |||| | NEW | NTW | celostátní publicistika – konkrétní tituly (MF, LN, HN, Právo) | 16,27 % | | ::: | NTW | celostátní publicistika – ostatní | 9,33 % | | ::: | REG | regionální publicistika | 3,91 % | | LEI | | volnočasová publicistika | 10,06 % | ==== Pojetí synchronie v jednotlivých reprezentativních korpusech ==== Vycházíme z předpokladu, že za [[pojmy:synchronni|synchronní]] lze považovat text, který se stále čte (resp. vydává), což v praxi indikuje rok vydání. Hranice synchronie se však u tří hlavních makroskupin liší: * pro beletrii platí strategie 25 + 75, tj. doba od prvního vydání nepřesahuje 75 let (přibližně tři žijící generace) a konkrétní vydání díla zařazovaného do korpusu není starší 25 let (zajištění současné recepce), * u odborných textů platí požadavek prvního vydání v posledních 25 letech, * hranice synchronie publicistických titulů zůstává nezměněna, tj. text musí být vydán v období mapovaném daným korpusem (například v případě SYN2025 je to období let 2020 až 2024). ===== Struktura korpusu SYN_R25 a strukturní značky ===== [[cnk:syn2025#struktura_korpusu_syn2025_a_strukturni_znacky|Hierarchie strukturních značek]] korpusu SYN_R25 je shodná se SYN2025: Nejvyšší [[pojmy:atributy_strukturni|strukturní jednotkou]] je ve shodě s mezinárodní konvencí dokument '''', který se skládá z jednoho nebo několika textů '''' (články v periodiku, kapitoly v knize nebo jiné smysluplné úseky). Texty se dále člení do odstavců ''

'' a vět ''''. Každá z těchto struktur je charakterizována konkrétními atributy, jejichž přehled uvádíme v následující tabulce. ^ '''' ^ Poznámka ^ '''' ^ Poznámka ^ ''

'' ^ Poznámka ^'' '' ^ Poznámka ^ | title | název dokumentu nebo periodika | [[seznamy:section|section]] | generovaný typ rubriky (u vybraných periodik) | id | jednoznačný identifikátor | id | jednoznačný identifikátor | | subtitle | podtitul | [[seznamy:section|section_orig]] | původní název rubriky (u vybraných periodik) | | author | autor dokumentu | author | autor článku (u vybraných periodik) | | | | | | issue | vydání (u periodik) | id | jednoznačný identifikátor | | | | | | publisher | vydavatel | | | | | | | | pubplace | místo vydání | | | | | | | | pubyear | rok vydání | | | | | | | | first_published | rok 1. vydání | | | | | | | | translator | překladatel | | | | | | | | [[seznamy:srclang|srclang]] | zdrojový jazyk | | | | | | | | [[seznamy:authsex-transsex|authsex]] | pohlaví autora | | | | | | | | [[seznamy:authsex-transsex|transsex]] | pohlaví překladatele | | | | | | | | [[seznamy:txtype_group|txtype_group]] | skupina textových typů | | | | | | | | [[seznamy:txtype|txtype]] | textový typ | | | | | | | | [[seznamy:genre_group|genre_group]] | skupina oborů | | | | | | | | [[seznamy:genre|genre]] | tematická oblast | | | | | | | | [[seznamy:med|medium]] | médium | | | | | | | | [[seznamy:periodicity|periodicity]] | periodicita | | | | | | | | [[seznamy:audience|audience]] | adresát | | | | | | | | isbnissn | ISBN/ISSN | | | | | | | | biblio | generovaný bibliografický údaj | | | | | | | | id | jednoznačný identifikátor | | | | | | | | syn | název jednoho ze šesti původních referenčních korpusů | | | | | | | Shoda struktury SYN_R25 se [[cnk:syn2025|SYN2025]] má pouze tuto výjimku: podobně jako v korpusech řady SYN přibyl i v korpusu SYN_R25 atribut '''' pro [[cnk:syn#referencni_korpusy_jako_subkorpusy_v_syn|vytváření subkorpusů odpovídajících původním referenčním korpusům]]. Kromě výše uvedených hierarchických struktur jsou v korpusu zaznamenány také následující struktury: * '''': zvýraznění a řezy písma (pouze tam, kde byly zachyceny ve vstupním formátu); * '''': označení hranice verše v poezii; * '''': označení [[seznamy:named_entities|pojmenovaných entit]]; * '''': označení poznámek pod čarou (pouze tam, kde byly zachyceny ve vstupním formátu); * '''' místo, kde byla v původním textu tabulka (nepárová struktura); * '''' místo, kde byl v původním textu webový odkaz (nepárová struktura); * '''' místo, kde byla v původním textu e-mailová adresa (nepárová struktura); * '''' místo, kde byl v původním textu grafický symbol, rovnice apod. (nepárová struktura); * '''' místo, kde byly v původním textu GPS souřadnice (nepárová struktura) * '''' místo, kde mezi dvěma po sobě následujícími tokeny //nebyla// v textu mezera (nepárová struktura), např. "70''''. léta". ===== Anotace SYN_R25 ===== Morfologické značkování, lemmatizace a tokenizace korpusu SYN_R25 probíhá plně automaticky podle [[cnk:anotacni_standard_cnk|anotačního standardu ČNK]], který byl aplikován již na korpus SYN2020. Tokenům jsou přiřazeny [[pojmy:atributy_pozicni|poziční atributy]]: [[pojmy:lemma|lemma]] a sublemma, [[pojmy:tag|tag]], [[pojmy:verbtag|verbtag]], pos a case.\\ Kromě toho je korpus opatřen [[pojmy:syntakticka_analyza|syntaktickým značkováním]] s řadou [[pojmy:atributy_pozicni|pozičních atributů]] přiřazených tokenům, např. [[seznamy:parent|parent]], [[seznamy:afun|afun]], [[seznamy:p_tag|p_tag]] (viz [[seznamy:syntakticke_znacky]]), [[seznamy:mwe|anotací víceslovných lexikálních jednotek]], [[seznamy:named_entities|anotací pojmenovaných entit]] a [[seznamy:verbform|značkováním složených slovesných tvarů]]. ====== Jak citovat SYN_r25 ====== Křen, M. – Cvrček, V. – Čapka, T. – Hnátková, M. – Jelínek, T. – Kocek, J. – Kováříková, D. – Křivan, J. – Marklová, A. – Petkevič, V. – Skoumalová, H. – Škrabal, M.: //SYN2025: reprezentativní korpus psané češtiny//. Ústav Českého národního korpusu FF UK, Praha 2025. Dostupný z WWW: http://www.korpus.cz Cvrček, V. – Čermáková, A. – Křen, M. (2016): Nová koncepce synchronních korpusů psané češtiny. //Slovo a slovesnost//, 77 (2), 83–101. Jelínek, T. – Křivan, J. – Petkevič, V. – Skoumalová, H. – Šindlerová, J. (2021): [[https://doi.org/10.1007/978-3-030-83527-9_4|SYN2020: A new corpus of Czech with an innovated annotation]]. In: K. Ekštein – F. Pártl – M. Konopík (eds.), //Text, Speech, and Dialogue.// TSD 2021. Lecture Notes in Computer Science, vol. 12848. Cham: Springer, 48–59. Křivan, J. – Šindlerová, J. (2022): [[https://asjournals.lib.cas.cz/slovoaslovesnost/article/uuid:286197ce-8b36-43ac-9563-eba2abf8ca0e|Změny v morfologické anotaci korpusů řady SYN: nové možnosti zkoumání české gramatiky a lexikonu]]. //Slovo a slovesnost//, 83 (2), 122–145.