Obě strany předchozí revizePředchozí verzeNásledující verze | Předchozí verzeNásledující verzeObě strany příští revize |
cnk:struktura [2018/07/30 14:55] – [Struktura Českého národního korpusu] Michal Škrabal | cnk:struktura [2018/07/30 15:00] – [Jednojazyčné] Michal Škrabal |
---|
O neformální, dialogické, mluvené češtině se nejvíc dozvíme z korpusů řady [[ORAL|ORAL]]. Tvoří ji korpusy **[[ORAL2013|ORAL2013]]** (2,8 mil.), [[ORAL2008|ORAL2008]] (1 mil.) a [[ORAL2006|ORAL2006]] (1 mil.). Všechny korpusy řady ORAL obsahují řadu sociolingvistických informací o mluvčích. Pouze ORAL2013 nabízí data z celé ČR a přístup i ke zvukové stopě, ostatní korpusy mluvené češtiny obsahují transkripci, která zachycuje a zohledňuje vybrané jevy [[pojmy:mluveny|mluveného jazyka]]. Tuto linii následuje korpus [[ORTOFON|ORTOFON]]. | O neformální, dialogické, mluvené češtině se nejvíc dozvíme z korpusů řady [[ORAL|ORAL]]. Tvoří ji korpusy **[[ORAL2013|ORAL2013]]** (2,8 mil.), [[ORAL2008|ORAL2008]] (1 mil.) a [[ORAL2006|ORAL2006]] (1 mil.). Všechny korpusy řady ORAL obsahují řadu sociolingvistických informací o mluvčích. Pouze ORAL2013 nabízí data z celé ČR a přístup i ke zvukové stopě, ostatní korpusy mluvené češtiny obsahují transkripci, která zachycuje a zohledňuje vybrané jevy [[pojmy:mluveny|mluveného jazyka]]. Tuto linii následuje korpus [[ORTOFON|ORTOFON]]. |
| |
Brněnskou češtinu z let 1994-1999 obsahuje v téměř pěti stech tisících slovech **[[BMK|Brněnský mluvený korpus]]**, **[[PMK|Pražský mluvený korpus]]** jakožto první korpus mluvené češtiny má téměř sedm set tisíc slov založených na nahrávkách z let 1988-1996. | Brněnskou češtinu z let 1994--1999 obsahuje v téměř pěti stech tisících slovech **[[BMK|Brněnský mluvený korpus]]**, **[[PMK|Pražský mluvený korpus]]** jakožto první korpus mluvené češtiny má téměř sedm set tisíc slov založených na nahrávkách z let 1988--1996. |
| |
Specializovaný korpus vyučovacích hodin **[[SCHOLA2010|SCHOLA2010]]** obsahuje 790 000 slov pronesených o školních hodinách učiteli i žáky - mluva dětí a mládeže jinak v mluvených korpusech řady Oral zachycena není. | Specializovaný korpus vyučovacích hodin **[[SCHOLA2010|SCHOLA2010]]** obsahuje 790 000 slov pronesených o školních hodinách učiteli i žáky - mluva dětí a mládeže jinak v mluvených korpusech řady Oral zachycena není. |
| |
Korpus **[[cnk:dialekt|DIALEKT]]** prezentuje tradiční teritoriální dialekty zachycené na území celé České republiky. Ve své první verzi obsahuje cca 100 000 slov a bude se postupně rozšiřovat. Nahrávky pocházejí ze dvou období, starší zahrnuje dobu od konce 50. let do 80. let 20. století, do nové vrstvy jsou zařazeny nahrávky z období od 90. let 20. století až do současnosti. Nářeční materiál je zpracováván tak, že má dvě úrovně přepisu: dialektologickou a ortografickou. | Korpus **[[cnk:dialekt|DIALEKT]]** prezentuje tradiční teritoriální dialekty zachycené na území celé České republiky. Ve své první verzi obsahuje cca 100 000 slov a bude se postupně rozšiřovat. Nahrávky pocházejí ze dvou období: starší zahrnuje dobu od konce 50. let do 80. let 20. století, do nové vrstvy jsou zařazeny nahrávky z období od 90. let 20. století až do současnosti. Nářeční materiál je zpracováván tak, že má dvě úrovně přepisu: dialektologickou a ortografickou. |
| |
===== Diachronní korpus ===== | ===== Diachronní korpus ===== |
==== Jednojazyčné ==== | ==== Jednojazyčné ==== |
| |
ČNK nezpřístupňuje pouze své vlastní korpusy, ale hostuje i řadu korpusů vytvořených jinde. Jedná se např. o **[[dotko|DOTKO]]** a **[[hotko|HOTKO]]**, nereferenční korpusy dolní a horní lužické srbštiny, které obsahují 12 a 36 milionů slov. Korpusy nejsou ani [[pojmy:lemma|lemmatizované]] ani [[pojmy:tag|morfologicky označkované]]. | ČNK nezpřístupňuje pouze své vlastní korpusy, ale hostuje i řadu korpusů vytvořených jinde. Jedná se např. o **[[dotko|DOTKO]]** a **[[hotko|HOTKO]]**, nereferenční korpusy dolní a horní lužické srbštiny, které obsahují 12 a 36 milionů slov. Korpusy nejsou ani [[pojmy:lemma|lemmatizované]], ani [[pojmy:tag|morfologicky označkované]]. |
| |
V rozhraní Kontext jsou rovněž přístupné rozsáhlé webové korpusy vytvořené mimo ČNK: | V rozhraní Kontext jsou rovněž přístupné rozsáhlé webové korpusy vytvořené mimo ČNK: |