Rozdíly

Zde můžete vidět rozdíly mezi vybranou verzí a aktuální verzí dané stránky.

--- manualy:wag [2020/09/23 10:18] – [WaG: Slovo v kostce] michalskrabal
+++ manualy:wag [2021/05/12 14:08] (aktuální) – jankocek
@@ Řádek 20: / Řádek 20: @@
 ===== Přehled jednotlivých prvků =====
+=== Frekvenční informace ===
 == Lemma ==
-ukazuje, jak jsme zadané slovo interpretovali. Pokud jste zadali slovo v jiném než základním tvaru (například //kočku//), tak jsme mu základní tvar neboli lemma přiřadili (//kočka//). Vyhledány jsou pak všechny tvary tohoto slova (tedy //kočky//, //kočce//, //kočkách// atd.). Ostatní interpretace (pokud nějaké jsou) se zobrazí nahoře pod vyhledávacím políčkem, kde lze také vybrat, jakou interpretaci chcete dále analyzovat (např. tvar //sní// může být zařazen k lemmatu //snít// nebo k lemmatu //sníst//).
+ukazuje, jak jsme zadané slovo interpretovali. Pokud jste zadali slovo v jiném než základním tvaru (například //kočku//), základní tvar neboli lemma jsme mu přiřadili (//kočka//). Vyhledány jsou pak všechny tvary tohoto slova (tedy //kočky//, //kočce//, //kočkách// atd.). Případné ostatní interpretace se zobrazí nahoře pod vyhledávacím políčkem, kde lze také vybrat, jakou interpretaci chcete dále analyzovat (např. tvar //sní// může být zařazen k lemmatu //snít// nebo k lemmatu //sníst//).
 == Slovní druh ==
-Zadané slovo bylo interpretováno tak, že patří právě k tomuto slovnímu druhu. Tohle je vhodné překontrolovat, pokud vyhledáváte slovo, které může mít více významů (například slovo //stát//, které může být slovesem nebo podstatným jménem). Stejně jako v předchozím případě se Vám naše interpretace nemusí líbit a stejně jako v předchozím případě si ji můžete změnit nahoře pod vyhledávacím políčkem.
+Zadané slovo bylo námi určitým způsobem interpretováno a přiřazeno k určitému slovnímu druhu. Výsledek je vhodné překontrolovat, zvláště hledáte-li slovo, které může mít více významů (například //stát// může být slovesem nebo podstatným jménem). Podobně jako v předchozím případě se vám naše interpretace nemusí líbit, vtom případě si ji můžete snadno změnit nahoře pod vyhledávacím políčkem.
 == Frekvenční pásmo ==
-názorně ukazuje, jak časté slovo je, jak často ho najdete v českých psaných textech. Čím víc hvězdiček, tím je častější. Pět hvězdiček má velmi malý počet slov, která se ale v psaných textech vyskytují extrémně často, např. //ale//, //já// nebo //muset//. Čtyři hvězdičky mají velmi častá slova jako //český//, //slovo// nebo //psát//. Na druhou stranu jednu hvězdičku mají málo frekventovaná slova, např. //chichotání//, //rozřezávat//, //pálenice// nebo //reverzibilní//.
+názorně ukazuje, jak frekventované dané slovo je, tj. jak často ho najdete v českých //psaných// textech. Čím víc má hvězdiček, tím je častější. Pět hvězdiček má jen velmi malý počet slov, která se ale v psaných textech vyskytují mimořádně často, např. //ale//, //já// nebo //muset//. Čtyři hvězdičky mají velmi častá slova jako //český//, //slovo// nebo //psát//. Naopak jednu hvězdičku mají málo frekventovaná slova, např. //chichotání//, //rozřezávat//, //pálenice// nebo //reverzibilní//.
 == Kolikrát v milionu slov ==
-Údaj podobně jako frekvenční pásmo (nebo [[pojmy:ipm|ipm]]) ukazuje, jak často se se slovem setkáte. Zde se ale uvádí přesné číslo – kolikrát ho průměrně najdete v milionu slov. Například hodnota 10 000 znamená, že přibližně každé sté slovo v českých textech bude to, které jste vyhledávali (tedy že ho najdete na jedné stránce třeba i několikrát). Hodnota 1 znamená, že se zadané slovo vyskytuje průměrně jen jednou v milionu slov, tedy že byste museli přečíst třeba i několik tlustých románů, než byste na něj vůbec narazili (Pro představu, jedno z nejčastějších českých slov //že// má hodnotu ipm 7923, na druhou stranu slovo //kvadrant// má ipm 1). Tomuto číslu se v lingvistice říká relativní frekvence normovaná na milion slov, anglicky //instances per million//, zkráceně ipm. Tato zkratka se používá i v dalších nástrojích ČNK, ale také jinde ve světě.
+Údaj podobně jako frekvenční pásmo (nebo [[pojmy:ipm|ipm]]) ukazuje, jak často se s daným slovem setkáte -- zde v přepočtu na korpus o velikosti 1 milion slov. Například hodnota 10 000 znamená, že přibližně každé sté slovo v českých textech bude vámi hledaný výraz, tedy že ho najdete na jedné stránce třeba i několikrát. Hodnota 1 znamená, že se zadané slovo vyskytuje průměrně v milionu slov jen jednou , tzn. že byste museli přečíst třeba i několik tlustých románů, než byste na něj vůbec narazili. (Pro představu, jedno z nejčastějších českých slov //že// má hodnotu ipm 7923, na druhou stranu slovo //kvadrant// má ipm 1)
 == Slova s podobně častým výskytem ==
-je seznam slov, které najdete v textech přibližně stejně často jako slovo, které jste si přáli vyhledat. Tento výčet není úplný, jde o náhodný výběr z podobně frekventovaných slov.
+je seznam výrazů, které najdete v textech přibližně stejně často jako vámi hledané slovo. Tento výčet není úplný, jde pouze o náhodný výběr z podobně frekventovaných slov.
 == Slovní tvary ==
-Vyhledány jsou všechny tvary zadaného slova. Tedy pokud jste do vyhledávacího políčka napsali //kočka//, vyhledali jsme i tvary //kočky//, //kočce//, //kočkách// atd. Četnost těchto tvarů je tu graficky znázorněna velikostí písma. Čím větším písmem je zaznamenán učitý tvar, tím častěji na něj v textech narazíte (barvy jsou vybírány náhodně).
+Vyhledány jsou všechny tvary zadaného slova. Pokud jste tedy do vyhledávacího políčka napsali //kočka//, vyhledali jsme i pádové tvary //kočky//, //kočce//, //kočkách// atd. Četnost těchto tvarů je graficky znázorněna velikostí písma: čím větším písmem je zaznamenán učitý tvar, tím častěji na něj v textech narazíte (barvy jsou vybírány náhodně).
-Pomocí ikonky v pravém horním rohu si můžete dlaždici přepnout do režimu tabulky. Tak se můžete podívat nejenom na relativní četnost (procentuální zastoupení) jednotlivých tvarů, ale i na absolutní počet, tedy kolikrát jsme daný slovní tvar našli v korpusu [[cnk:syn2015|SYN2015]].
+Pomocí ikonky v pravém horním rohu si lze dlaždici přepnout do režimu tabulky. Tak se můžete podívat nejenom na relativní četnost (procentuální zastoupení) jednotlivých tvarů, ale i na absolutní počet, tedy kolikrát jsme daný slovní tvar našli v korpusu [[cnk:syn2015|SYN2015]].
 == Frekvence podle typu textu ==
-V grafu je vidět, v jakém [[pojmy:txtype_group|typu textů]] se vyhledané slovo používá nejčastěji. Korpus jsme rozdělili na oborovou literaturu, která zahrnuje odborné, populárně naučné a jinak oborově specializované texty, dále publicistiku (tedy noviny a časopisy), beletrii (romány, povídky, poezie a podobně) a konečně mluvený jazyk – přepisy neformálních rozhovorů, které po celé České republice nahrávali naši spolupracovníci.
+Z grafu je patrné, v jakém [[pojmy:txtype_group|typu textů]] se vyhledané slovo používá nejčastěji. Údaje jsou uváděny v relativní frekvenci, absolutní četnosti výskytů jsou k dispozici v tabulce.
-Pro tyto skupiny textů jsme zjistili průměrný počet výskytů zadaného slova v milionu slov, tedy informaci o tom, jak často se se slovem v daném typu textů setkáte. Průměrný počet výskytů v milionu slov je četnost relativní, tedy vztažená k velikosti korpusu. Pokud Vás zajímá četnost absolutní – tedy kolikrát jsme vámi zadané slovo v daném typu textů našli, pak si v pravém horním rohu dlaždice můžete přepnout zobrazení na tabulku.
+Tip: Pro srovnání si můžete vyhledat slova, která se typicky vyskytují v jednom z typů textů, např.: //premiér//, //nebesa//, //experiment//, //prostě//.
-Pro srovnání si můžete vyhledat slova, která se typicky vyskytují v jednom z typů textů, např.: //premiér//, //nebesa//, //experiment//, //prostě//.
+{{:manualy:wag_frekvencni_informace.png?nolink&900|}}
+=== Psaný jazyk ===
 ==Kolokace==
-[[pojmy:kolokace|Kolokace]] jsou ustálená (tj. nenahodilá) smysluplná spojení slov v blízkém kontextu. Zjednodušeně by se dalo říct, že kolokace jsou spojení slov, která se často vyskytují spolu. Příkladem můžou být třeba kolokace //letní prázdniny//, //zavázat (si) tkaničky//, //hladká mouka//, //vypálit (někomu) rybník// nebo //tmavě modrá//. K nalézání kolokací se užívají statistické metody (tzv. [[pojmy:asociacni_miry|asociační míry]]). Čím větším písmem je dané slovo zaznamenáno, tím silnější kolokaci se zadaným slovem tvoří (barvy jsou vybírány náhodně).
+[[pojmy:kolokace|Kolokace]] jsou ustálená (tj. nenahodilá) smysluplná spojení slov v blízkém kontextu. Příkladem můžou být třeba kolokace //letní prázdniny//, //zavázat (si) tkaničky//, //hladká mouka//, //vypálit (někomu) rybník// nebo //tmavě modrá//. K nalézání kolokací se užívají statistické metody (tzv. [[pojmy:asociacni_miry|asociační míry]]). Čím větším písmem je dané slovo zaznamenáno, tím silnější kolokaci se zadaným slovem tvoří (barvy jsou vybírány náhodně).
 Kliknutím na ikonku nastavení můžete omezit prohledávaný kontext pouze na levou, či pravou stranu. Najetím kurzoru na konkrétní slovo se podbarví odpovídající příkladová věta v dlaždici vpravo. (Pozor! Kolokace může překračovat hranici věty, a kolokát se tudíž nemusí v příkladové větě objevit.)
@@ Řádek 71: / Řádek 73: @@
 Tloušťka čáry v grafu se odvozuje od tzv. konfidenčního intervalu, který udává, jak spolehlivá data pro výzkum zadaného jevu máme. Čím je čára tlustší, tím méně spolehlivá data pro identifikaci daného trendu máme.
-Kliknutím na ikonku nastavení můžete výsledky porovnat s vývojem jiného slova (porovnejte např. slova média a tisk).
+Kliknutím na ikonku nastavení můžete výsledky porovnat s vývojem jiného slova (porovnejte např. slova //média// a //tisk//).
 ==Podobně používaná slova==
@@ Řádek 78: / Řádek 80: @@
 Pro určení podobných slov byl použit program Wang2Vec (alternativa k známějšímu Word2Vec) s metodou pro výpočet parametrů modelu Noise Contrastive Estimation.
+{{:manualy:wag_psany_jazyk.png?nolink&900|}}
+=== Mluvený jazyk ===
 ==Frekvence slova podle mluvčích (sociodemografické údaje)==
-V grafech je vidět, jak často je zadané slovo používáno skupinami mluvčích podle pohlaví, věku a nejvyššího dosaženého vzdělání. Pro představu si můžete vyhledat slova jako //vole// (lemma //vůl//), //princip// nebo //řasenka//. Všechny frekvenční údaje jsou uváděny v ipm, to znamená, že se zaznamenává počet výskytů slova v miliónu slov.
+Z grafů je patrné, jak často je zadané slovo používáno skupinami mluvčích podle pohlaví, věku a nejvyššího dosaženého vzdělání. Pro představu si můžete vyhledat slova jako //vole// (lemma //vůl//), //princip// nebo //řasenka//. Všechny frekvenční údaje jsou uváděny v ipm.
 ==Oblasti podle tradičního nářečního členění==
@@ Řádek 89: / Řádek 96: @@
 ==Ukázka autentické promluvy==
-Ukázky použití slova v autentických promluvách. Kliknutím na šipky směrem nahoru a dolů rozšíříte vybranou ukázku, šipka doprava vybere novou ukázku. Kliknutím na ikonku reproduktoru si lze přehrát krátkou část ukázky, pokud chcete přehrát ukázku celou, klikněte na Přehrát vše.
+Ukázky použití slova v autentických promluvách, jak je máme zachyceny v korpusu mluvené češtiny [[cnk:oral|Oral]]. Kliknutím na šipky směrem nahoru a dolů rozšíříte vybranou ukázku, šipka doprava vybere novou ukázku. Kliknutím na ikonku reproduktoru si lze přehrát krátkou část ukázky, pokud chcete přehrát ukázku celou, klikněte na Přehrát vše.
+{{:manualy:wag_mluveny_jazyk.png?nolink&900|}}
+=== Překlad na základě paralelního korpusu ===
+==Doložené překlady==
+Dlaždice ukazuje překladové ekvivalenty získané pomocí nástroje [[manualy:treq|Treq]], jenž využívá data paralelního korpusu [[cnk:intercorp|InterCorp]]. [[manualy:treq|Treq]] automaticky vyhodnocuje kandidáty na překladové ekvivalenty a řídí se pravidlem, že čím se častěji konkrétní překlad vyhledávaného slova v korpusu objevil, tím je větší pravděpodobnost, že se běžně používá. Výsledek není tedy ručně ověřován. Velikost písma souvisí s četností překladu daného ekvivalentu.
+==Překlad v různých typech textu==
+Zde se lze podívat na přehled různých překladů podle jednotlivých typů textů, které často souvisí s jiným kontextem. Např. jinak se bude překládat do angličtiny lexém //hustý// v publicistice (//dense//), a jinak ve filmových titulcích (//cool//). Díky tomuto srovnání lze nahlížet nejen na samotný překladový ekvivalent, ale i na jeho vhodnost s ohledem na určitý žánr.
+==Ukázky překladu==
+Ukázky překladu v paralelních textech pocházejí z korpusu [[cnk:intercorp|InterCorp]]. Informační ikonka skrývá údaje o textu (např. autor, rok vydání, typ textu)
 ===== Jak citovat WaG =====

Historie: • wag

Rozdíly

Hledat

Navigace

Tisk/export

Nástroje

Jazyky

Licence