| Obě strany předchozí revizePředchozí verzeNásledující verze | Předchozí verze |
| cnk:dialekt [2022/01/05 17:30] – michalkren | cnk:dialekt [2026/06/30 11:58] (aktuální) – [Zpracování nářečních nahrávek] martinawaclawicova |
|---|
| ^ Počet [[pojmy:word| slovních tvarů (wordů)]] | 33 715| 25 360| | ^ Počet [[pojmy:word| slovních tvarů (wordů)]] | 33 715| 25 360| |
| ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|nahrávek]] | 972|| | ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|nahrávek]] | 972|| |
| ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|promluv]] | 43 628|| | ^ Počet [[seznamy:strukturni_atributy_mluvene|promluv]] | 43 628|| |
| ^ Počet mluvčích | 291|| | ^ Počet mluvčích | 291|| |
| ^ Délka nahrávek (hh:mm:ss.ms) | 27:43:21.423|| | ^ Délka nahrávek (hh:mm:ss.ms) | 27:43:21.423|| |
| ^ Počet [[pojmy:word| slovních tvarů (wordů)]] | 19 189| 15 061| | ^ Počet [[pojmy:word| slovních tvarů (wordů)]] | 19 189| 15 061| |
| ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|nahrávek]] | 324|| | ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|nahrávek]] | 324|| |
| ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|promluv]] | 9 745|| | ^ Počet [[seznamy:strukturni_atributy_mluvene|promluv]] | 9 745|| |
| ^ Počet mluvčích | 178|| | ^ Počet mluvčích | 178|| |
| ^ Délka nahrávek (hh:mm:ss.ms) | 12:40:24.771|| | ^ Délka nahrávek (hh:mm:ss.ms) | 12:40:24.771|| |
| ====== Zpracování nářečních nahrávek ====== | ====== Zpracování nářečních nahrávek ====== |
| |
| Nářeční materiál je v korpusu **DIALEKT** zpracováván tak, že má dvě úrovně přepisu – dialektologickou a ortografickou, viz [[cnk:dialekt:pravidla|transkripční zásady]]. Základní přepis je dialektologický a vychází z pravidel pro přepis vědeckých dialektologických textů (použité speciální znaky jsou uvedeny v [[cnk:dialekt:archivhlasek|Archivu diferenčních hlásek nářečí českého jazyka]]). Druhou úroveň přepisu představuje ortografický přepis, blížící se bežné podobě psaných textů, jenž je srovnatelný s obecnými pravidly stanovenými pro mluvené korpusy v Českém národním korpusu (ČNK). | Nářeční materiál je v korpusu **DIALEKT** zpracováván za pomoci nástroje [[https://archive.mpi.nl/tla/elan|ELAN]], vyvinutého v Max Planck Institute for Psycholinguistics v Nijmegen((ELAN (Version 7.1) [Computer software]. (2026). Nijmegen: Max Planck Institute for Psycholinguistics. Retrieved from https://archive.mpi.nl/tla/elan |
| | )). Každý přepis má dvě úrovně přepisu – dialektologickou a ortografickou, viz [[cnk:dialekt:pravidla|transkripční zásady]]. Základní přepis je dialektologický a vychází z pravidel pro přepis vědeckých dialektologických textů (použité speciální znaky jsou uvedeny v [[cnk:dialekt:archivhlasek|Archivu diferenčních hlásek nářečí českého jazyka]]). Druhou úroveň přepisu představuje ortografický přepis, blížící se bežné podobě psaných textů, jenž je srovnatelný s obecnými pravidly stanovenými pro mluvené korpusy v Českém národním korpusu (ČNK). |
| Korpus **DIALEKT** je podobně jako korpus **[[cnk:oral|ORAL]]** a **[[cnk:ortofon|ORTOFON]]** [[cnk:lemtag_mluv|lemmatizovaný a morfologicky označkovaný]]. Vzhledem k velké variabilitě nářečního materiálu a nedostatku trénovacích dat byl ale proces značkování a lemmatizace značně komplikovaný a s vědomím toho je také třeba k výsledku přistupovat. | Korpus **DIALEKT** je podobně jako korpus **[[cnk:oral|ORAL]]** a **[[cnk:ortofon|ORTOFON]]** [[cnk:lemtag_mluv|lemmatizovaný a morfologicky označkovaný]]. Vzhledem k velké variabilitě nářečního materiálu a nedostatku trénovacích dat byl ale proces značkování a lemmatizace značně komplikovaný a s vědomím toho je také třeba k výsledku přistupovat. |
| |
| |
| </WRAP> | </WRAP> |
| | |
| |
| ===== Související odkazy ===== | ===== Související odkazy ===== |