| Obě strany předchozí revizePředchozí verzeNásledující verze | Předchozí verze |
| cnk:dialekt [2022/01/03 10:14] – [Jak citovat] golanova | cnk:dialekt [2026/06/30 11:58] (aktuální) – [Zpracování nářečních nahrávek] martinawaclawicova |
|---|
| ^ Počet [[pojmy:word| slovních tvarů (wordů)]] | 33 715| 25 360| | ^ Počet [[pojmy:word| slovních tvarů (wordů)]] | 33 715| 25 360| |
| ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|nahrávek]] | 972|| | ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|nahrávek]] | 972|| |
| ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|promluv]] | 43 628|| | ^ Počet [[seznamy:strukturni_atributy_mluvene|promluv]] | 43 628|| |
| ^ Počet mluvčích | 291|| | ^ Počet mluvčích | 291|| |
| ^ Délka nahrávek (hh:mm:ss.ms) | 27:43:21.423|| | ^ Délka nahrávek (hh:mm:ss.ms) | 27:43:21.423|| |
| ^ Počet [[pojmy:word| slovních tvarů (wordů)]] | 19 189| 15 061| | ^ Počet [[pojmy:word| slovních tvarů (wordů)]] | 19 189| 15 061| |
| ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|nahrávek]] | 324|| | ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|nahrávek]] | 324|| |
| ^ Počet [[pojmy:atributy_strukturni#struktura_korpusu_mluvene_cestiny|promluv]] | 9 745|| | ^ Počet [[seznamy:strukturni_atributy_mluvene|promluv]] | 9 745|| |
| ^ Počet mluvčích | 178|| | ^ Počet mluvčích | 178|| |
| ^ Délka nahrávek (hh:mm:ss.ms) | 12:40:24.771|| | ^ Délka nahrávek (hh:mm:ss.ms) | 12:40:24.771|| |
| ====== Zpracování nářečních nahrávek ====== | ====== Zpracování nářečních nahrávek ====== |
| |
| Nářeční materiál je v korpusu **DIALEKT** zpracováván tak, že má dvě úrovně přepisu – dialektologickou a ortografickou, viz [[cnk:dialekt:pravidla|transkripční zásady]]. Základní přepis je dialektologický a vychází z pravidel pro přepis vědeckých dialektologických textů (použité speciální znaky jsou uvedeny v [[cnk:dialekt:archivhlasek|Archivu diferenčních hlásek nářečí českého jazyka]]). Druhou úroveň přepisu představuje ortografický přepis, blížící se bežné podobě psaných textů, jenž je srovnatelný s obecnými pravidly stanovenými pro mluvené korpusy v Českém národním korpusu (ČNK). | Nářeční materiál je v korpusu **DIALEKT** zpracováván za pomoci nástroje [[https://archive.mpi.nl/tla/elan|ELAN]], vyvinutého v Max Planck Institute for Psycholinguistics v Nijmegen((ELAN (Version 7.1) [Computer software]. (2026). Nijmegen: Max Planck Institute for Psycholinguistics. Retrieved from https://archive.mpi.nl/tla/elan |
| | )). Každý přepis má dvě úrovně přepisu – dialektologickou a ortografickou, viz [[cnk:dialekt:pravidla|transkripční zásady]]. Základní přepis je dialektologický a vychází z pravidel pro přepis vědeckých dialektologických textů (použité speciální znaky jsou uvedeny v [[cnk:dialekt:archivhlasek|Archivu diferenčních hlásek nářečí českého jazyka]]). Druhou úroveň přepisu představuje ortografický přepis, blížící se bežné podobě psaných textů, jenž je srovnatelný s obecnými pravidly stanovenými pro mluvené korpusy v Českém národním korpusu (ČNK). |
| Korpus **DIALEKT** je podobně jako korpus **[[cnk:oral|ORAL]]** a **[[cnk:ortofon|ORTOFON]]** [[cnk:lemtag_mluv|lemmatizovaný a morfologicky označkovaný]]. Vzhledem k velké variabilitě nářečního materiálu a nedostatku trénovacích dat byl ale proces značkování a lemmatizace značně komplikovaný a s vědomím toho je také třeba k výsledku přistupovat. | Korpus **DIALEKT** je podobně jako korpus **[[cnk:oral|ORAL]]** a **[[cnk:ortofon|ORTOFON]]** [[cnk:lemtag_mluv|lemmatizovaný a morfologicky označkovaný]]. Vzhledem k velké variabilitě nářečního materiálu a nedostatku trénovacích dat byl ale proces značkování a lemmatizace značně komplikovaný a s vědomím toho je také třeba k výsledku přistupovat. |
| |
| ===== Jak citovat ===== | ===== Jak citovat ===== |
| <WRAP round tip 70%> | <WRAP round tip 70%> |
| | |
| Goláňová, H. – Waclawičová, M. – Lukeš, D.: //DIALEKT: nářeční korpus, verze 2 z 23. 12. 2021//. Ústav Českého národního korpusu FF UK, Praha 2021. Dostupný z WWW: http://www.korpus.cz\\ | Goláňová, H. – Waclawičová, M. – Lukeš, D.: //DIALEKT: nářeční korpus, verze 2 z 23. 12. 2021//. Ústav Českého národního korpusu FF UK, Praha 2021. Dostupný z WWW: http://www.korpus.cz\\ |
| |
| Goláňová, H. – Waclawičová, M. – Komrsková, Z. – Lukeš, D. – Kopřivová, M. – Poukarová, P.: //DIALEKT: nářeční korpus, verze 1 z 2. 6. 2017//. Ústav Českého národního korpusu FF UK, Praha 2017. Dostupný z WWW: http://www.korpus.cz\\ | Goláňová, H. – Waclawičová, M. – Komrsková, Z. – Lukeš, D. – Kopřivová, M. – Poukarová, P.: //DIALEKT: nářeční korpus, verze 1 z 2. 6. 2017//. Ústav Českého národního korpusu FF UK, Praha 2017. Dostupný z WWW: http://www.korpus.cz\\ |
| |
| Komrsková, Z. - Kopřivová, M. - Lukeš, D. - Poukarová, P. - Goláňová, H. (2017): New Spoken Corpora of Czech: ORTOFON and DIALEKT. //Jazykovedný časopis//, 68(2), 219-228. ISSN 0021-8897. | Goláňová, H. – Waclawičová, M. (2019): The DIALEKT corpus and its possibilities. //Jazykovedný časopis//, 70(2), 336-344. ISSN 0021-5597.\\ |
| | |
| | Komrsková, Z. - Kopřivová, M. - Lukeš, D. - Poukarová, P. - Goláňová, H. (2017): New Spoken Corpora of Czech: ORTOFON and DIALEKT. //Jazykovedný časopis//, 68(2), 219-228. ISSN 0021-8897.\\ |
| |
| Goláňová, H. (2015): A new dialect corpus: DIALEKT. In Katarína Gajdošová - Adriana Žáková (eds.): //Proceedings of the Eight International Conference Slovko 2015 (Natural Language Processing, Corpus Linguistics, Lexicography)//. Lüdenscheid: RAM-Verlag, 36-44. ISBN 978-3-942303-32-3.\\ | Goláňová, H. (2015): A new dialect corpus: DIALEKT. In Katarína Gajdošová - Adriana Žáková (eds.): //Proceedings of the Eight International Conference Slovko 2015 (Natural Language Processing, Corpus Linguistics, Lexicography)//. Lüdenscheid: RAM-Verlag, 36-44. ISBN 978-3-942303-32-3.\\ |
| |
| Budováním korpusu a koordinací projektu se zabývala //Hana Goláňová//, přípravou korpusu a kontrolou transkripce //Martina Waclawičová//, transkripcí na ortografické úrovni //Zuzana Komrsková//, technickou tvorbou korpusu //David Lukeš// a lemmatizaci a morfologické značkování připravili //Zuzana Komrsková//, //Marie Kopřivová//, //David Lukeš// a //Petra Poukarová//. | </WRAP> |
| |
| ===== Související odkazy ===== | ===== Související odkazy ===== |