AplikaceAplikace
Nastavení

Rozdíly

Zde můžete vidět rozdíly mezi vybranou verzí a aktuální verzí dané stránky.

Odkaz na výstup diff

Obě strany předchozí revizePředchozí verze
Následující verze
Předchozí verze
Následující verzeObě strany příští revize
cnk:struktura [2018/07/30 14:55] – [Struktura Českého národního korpusu] Michal Škrabalcnk:struktura [2018/07/30 15:00] – [Jednojazyčné] Michal Škrabal
Řádek 21: Řádek 21:
 O neformální, dialogické, mluvené češtině se nejvíc dozvíme z korpusů řady [[ORAL|ORAL]]. Tvoří ji korpusy **[[ORAL2013|ORAL2013]]** (2,8 mil.), [[ORAL2008|ORAL2008]] (1 mil.) a [[ORAL2006|ORAL2006]] (1 mil.). Všechny korpusy řady ORAL obsahují řadu sociolingvistických informací o mluvčích. Pouze ORAL2013 nabízí data z celé ČR a přístup i ke zvukové stopě, ostatní korpusy mluvené češtiny obsahují transkripci, která zachycuje a zohledňuje vybrané jevy [[pojmy:mluveny|mluveného jazyka]]. Tuto linii následuje korpus [[ORTOFON|ORTOFON]]. O neformální, dialogické, mluvené češtině se nejvíc dozvíme z korpusů řady [[ORAL|ORAL]]. Tvoří ji korpusy **[[ORAL2013|ORAL2013]]** (2,8 mil.), [[ORAL2008|ORAL2008]] (1 mil.) a [[ORAL2006|ORAL2006]] (1 mil.). Všechny korpusy řady ORAL obsahují řadu sociolingvistických informací o mluvčích. Pouze ORAL2013 nabízí data z celé ČR a přístup i ke zvukové stopě, ostatní korpusy mluvené češtiny obsahují transkripci, která zachycuje a zohledňuje vybrané jevy [[pojmy:mluveny|mluveného jazyka]]. Tuto linii následuje korpus [[ORTOFON|ORTOFON]].
  
-Brněnskou češtinu z let 1994-1999 obsahuje v téměř pěti stech tisících slovech **[[BMK|Brněnský mluvený korpus]]**, **[[PMK|Pražský mluvený korpus]]** jakožto první korpus mluvené češtiny má téměř sedm set tisíc slov založených na nahrávkách z let 1988-1996.  +Brněnskou češtinu z let 1994--1999 obsahuje v téměř pěti stech tisících slovech **[[BMK|Brněnský mluvený korpus]]**, **[[PMK|Pražský mluvený korpus]]** jakožto první korpus mluvené češtiny má téměř sedm set tisíc slov založených na nahrávkách z let 1988--1996.  
  
 Specializovaný korpus vyučovacích hodin **[[SCHOLA2010|SCHOLA2010]]** obsahuje 790 000 slov pronesených o školních hodinách učiteli i žáky - mluva dětí a mládeže jinak v mluvených korpusech řady Oral zachycena není. Specializovaný korpus vyučovacích hodin **[[SCHOLA2010|SCHOLA2010]]** obsahuje 790 000 slov pronesených o školních hodinách učiteli i žáky - mluva dětí a mládeže jinak v mluvených korpusech řady Oral zachycena není.
  
-Korpus **[[cnk:dialekt|DIALEKT]]** prezentuje tradiční teritoriální dialekty zachycené na území celé České republiky. Ve své první verzi obsahuje cca 100 000 slov a bude se postupně rozšiřovat. Nahrávky pocházejí ze dvou obdobístarší zahrnuje dobu od konce 50. let do 80. let 20. století, do nové vrstvy jsou zařazeny nahrávky z období od 90. let 20. století až do současnosti. Nářeční materiál je zpracováván tak, že má dvě úrovně přepisu: dialektologickou a ortografickou.+Korpus **[[cnk:dialekt|DIALEKT]]** prezentuje tradiční teritoriální dialekty zachycené na území celé České republiky. Ve své první verzi obsahuje cca 100 000 slov a bude se postupně rozšiřovat. Nahrávky pocházejí ze dvou obdobístarší zahrnuje dobu od konce 50. let do 80. let 20. století, do nové vrstvy jsou zařazeny nahrávky z období od 90. let 20. století až do současnosti. Nářeční materiál je zpracováván tak, že má dvě úrovně přepisu: dialektologickou a ortografickou.
  
 ===== Diachronní korpus ===== ===== Diachronní korpus =====
Řádek 35: Řádek 35:
 ==== Jednojazyčné ==== ==== Jednojazyčné ====
  
-ČNK nezpřístupňuje pouze své vlastní korpusy, ale hostuje i řadu korpusů vytvořených jinde. Jedná se např. o **[[dotko|DOTKO]]** a **[[hotko|HOTKO]]**, nereferenční korpusy dolní a horní lužické srbštiny, které obsahují 12 a 36 milionů slov. Korpusy nejsou ani [[pojmy:lemma|lemmatizované]] ani [[pojmy:tag|morfologicky označkované]].+ČNK nezpřístupňuje pouze své vlastní korpusy, ale hostuje i řadu korpusů vytvořených jinde. Jedná se např. o **[[dotko|DOTKO]]** a **[[hotko|HOTKO]]**, nereferenční korpusy dolní a horní lužické srbštiny, které obsahují 12 a 36 milionů slov. Korpusy nejsou ani [[pojmy:lemma|lemmatizované]]ani [[pojmy:tag|morfologicky označkované]].
  
 V rozhraní Kontext jsou rovněž přístupné rozsáhlé webové korpusy vytvořené mimo ČNK:  V rozhraní Kontext jsou rovněž přístupné rozsáhlé webové korpusy vytvořené mimo ČNK: