AplikaceAplikace
Nastavení

Rozdíly

Zde můžete vidět rozdíly mezi vybranou verzí a aktuální verzí dané stránky.

Odkaz na výstup diff

Následující verze
Předchozí verze
manual:kwords [2014/11/25 17:31] – vytvořeno vaclavcvrcekmanualy:kwords [2024/01/16 10:37] (aktuální) – [Jak citovat KWords] aktualizovat pro druhou verzi vhorky
Řádek 1: Řádek 1:
 ====== KWords ====== ====== KWords ======
  
-Aplikace KWords slouží k analýze textů na základě jejich srovnání s obecným územ (referenčním korpusem).+{{ :manualy:kwords_logo_v2.png?nolink&|}}
  
-{{ :manual:kwords-logo.png?nolink&100|}}+Aplikace KWords slouží k analýze textů na základě jejich srovnání s obecným územ ([[pojmy:referencni|referenčním]] korpusem). Jejím cílem je identifikovat tzv. [[pojmy:keyword|klíčová slova]] (keywords), což jsou [[pojmy:word|slovní tvary]] nebo [[pojmy:lemma|lemmata]], která se ve zkoumaném textu objevují významně častěji než v referenčním korpusu, který má zrcadlit běžný jazykový úzus. Tato klíčová slova slouží pak jako základ pro textovou analýzu a interpretaci. 
 + 
 +KWords je webová aplikace (k jejímu užívání stačí internetový prohlížeč) a je dostupná bez [[kurz:zaciname|registrace]] všem uživatelům na adrese **[[http://kwords.korpus.cz|kwords.korpus.cz]]**.  
 + 
 +První verze aplikace KWords byla vyvinuta pro účely analýzy politických projevů v rámci spolupráce s [[http://www.brown.edu|Brownovou univerzitou]]. Druhá verze vznikla v rámci projektu [[https://threat-defuser.org|Threat-defuser]]. Tato verze podporuje více než 30 jazyků a umožňuje vedle analýzy klíčových slov i tzv. keymorph analýzu.((viz Fidler, M. - Cvrček, V.: [[https://doi.org/10.1515/cllt-2016-0073|Keymorph analysis, or how morphosyntax informs discourse]]. Corpus Linguistics and Linguistic Theory. 15/1, p. 39–70.)) 
 + 
 +===== Prominentní jednotky ===== 
 + 
 +Aplikace KWords identifikuje dva typy prominentních slov: 
 + 
 +  - Klíčová slova ([[pojmy:keyword|keywords]]) 
 +  - Slova nesoucí tématickou koncentraci (TC) textu  
 + 
 +==== Klíčová slova ==== 
 + 
 +Identifikace [[pojmy:keyword|klíčových slov]] probíhá na základě srovnání relativní [[pojmy:frekvence|frekvence]] každého slova ve zkoumaném textu s relativní frekvencí téhož slova v referenčním korpusu. Pro zjištění statistické signifikance rozdílů se užívá několik testů, v rámci KWords jsou implementovány dva: [[pojmy:chi2|chi2]] a [[pojmy:loglikelihood|log-likelihood]]. 
 + 
 +Výsledky analýzy klíčových slov jsou vždy ovlivněny volbou referenčního korpusu, který je třeba chápat jako neutrální jazykové pozadí, s nímž porovnáváme zkoumaný text. Např. při zkoumání novoročních projevů posledního komunistického prezidenta G. Husáka se jako prominentní ve srovnání se současným územ jeví slova //socialistický//, //soudružky// apod., nikoli ovšem při srovnání s dobovým referenčním korpusem. Jako referenční korpus je v aplikaci KWords v současné době možné použít jazykové větve korpusu [[cnk:intercorp|InterCorp]]. 
 + 
 +==== Tématická koncentrace ==== 
 + 
 +Slova, která jsou v analyzovaném textu vyznačena žlutým podbarvením, jsou ta, která nesou tématickou koncentraci (TC words). K jejich identifikaci se nevyužívá srovnání s referenčním korpusem, ale pouze jejich umístění ve frekvenční distribuci jednotek analyzovaného textu: seřadíme-li všechna slova v textu od nejfrekventovanějšího po slova, která se objevují pouze jednou, dostaneme tzv. [[pojmy:zipf|Zipfovskou]] distribuci. Na této distribuci hledáme tzv. bod //h//, pro nějž platí, že rank = frekvence (např. 32. nejfrekventovanější slovo má frekvenci 32 výskytů). Všechna plnovýznamová slova nad tímto bodem (tj. v našem případě s frekvencí vyšší než 32) označíme za tématickou koncentraci. Podrobnosti a konkrétní aplikaci tohoto přístupu na literární texty je možné najít např. v článku [[http://www.cechradek.cz/publ/2013_Davidova_Cech_Tematicka_koncentrace_Jehlicka_NR.pdf|R. Čecha]] (2013).
  
 ===== Princip fungování ===== ===== Princip fungování =====
  
 +Text vložený uživatelem se nejprve [[pojmy:token|roztokenizuje]] způsobem, který je identický s tokenizací korpusových dat. V druhém kroku je spočtena frekvence všech slov v analyzovaném textu (s výjimkou těch, které uživatel z analýzy vyloučí prostřednictvím tzv. stop-listu, např. předložky, spojky, čísla apod.). Následuje porovnání frekvencí v textu a v referenčním korpusu. Pro jednotky, u nichž byl zaznamenán statisticky signifikantní rozdíl (podle zvoleného statistického testu -- [[pojmy:chi2|chi2]] či [[pojmy:loglikelihood|log-likelihood]]), je dále vypočítána hodnota **DIN** (difference index) vypovídající o relevanci daného rozdílu:
  
 +$$DIN = 100 \times \frac{RelFq(Ttxt) - RelFq(RefC)}{RelFq(Ttxt) + RelFq(RefC)}$$
 +
 +kde $RelFq(Ttxt)$ je relativní frekvence jevu ve zkoumaném textu (target text) a $RelFq(RefC)$ je relativní frekvence téhož jevu v referenčním korpusu. Hodnoty DIN, podle nichž jsou klíčová slova ve výpisu programu seřazena, mohou dosahovat hodnot od -100 do 100, přičemž platí, že:
 +  * hodnota -100 znamená, že daný jev se ve zkoumaném textu nevyskytuje, je pouze v referenčním korpusu (slovo tedy není ve zkoumaném textu prominentní)
 +  * hodnota 0 znamená, že daný jev má zhruba stejnou relativní frekvenci ve zkoumaném textu i v referenčním korpusu (slovo tedy není ve zkoumaném textu prominentní)
 +  * hodnota 100 značí, že slovo se vyskytuje pouze ve zkoumaném textu (může se tedy jednat o velmi prominentní slovo((V takovýchto případech je třeba mít na paměti, že absence slova v referenčním korpusu je situace zvláštní, která je vždy hodna speciálního pozoru; slovo se v referenčním korpusu nemusí vyksytovat např. proto, že jde o velmi řídký jev, zvlaštní proprium, citátové slovo z jiného jazyka apod.)))
 +
 +V textech o rozsahu do 20 tisíc slov a při analýze [[pojmy:word|slovních tvarů]] je možné považovat hodnoty DIN v rozmezí 75-100 za velmi zajímavé a značí, že se jedná pravděpodobně o prominentní jednotku, která může dobře posloužit jako východisko pro interpretaci celého textu.
 +
 +Aplikace KWords dále nabízí celou řadu doplňujících informací pro práci s klíčovými slovy. Vedle seznamu klíčových slov spolu s jejich hodnotami je to především graf disperze dat (ukazující postavení jednotlivých klíčových slov v textu), graf tzv. keyword links, tj. vztahů mezi klíčovými slovy v textu a také konkordanci klíčových slov pro analýzu jejich bezprostředního okolí.
 +
 +Aplikace KWords byla navržena také pro vytváření analýz časových (nebo jiných) sérií dat. Pokud uživatel vloží na vstupu do aplikace víc textů (maximální množství je 20), aktivuje režim tzv. **multi-analýzy**. V něm jsou analyzovány všechny vložené texty a výsledky z jednotlivých analýz porovnány na základě DIN.
 ===== Obrázky aplikace ===== ===== Obrázky aplikace =====
 +{{:manualy:kwords2.png?direct&400 |}}
 +{{:manualy:kwords2_nastaveni.png?direct&400 |}}
 +{{:manualy:kwords2_klicova_slova.png?direct&400|}}
 +{{:manualy:kwords2_graf.png?direct&400 |}}
 +{{:manualy:kwords2_distribuce.png?direct&400 |}}
 +{{:manualy:kwords2_konkordance.png?direct&400 |}}
 +{{:manualy:kwords2_links.png?direct&400|}}
 +
 +
 +===== Obrázky aplikace (předchozí verze) =====
 +
 +[{{:kurz:kwords-vstup.png?direct&400 |Zadávání textu do KWords}}]
 +[{{:kurz:kwords-vystup.png?direct&400 |Analyzovaný text spolu s vyznačenými klíčovými slovy}}] 
 +[{{:kurz:kwords-tab.png?direct&400|Seznam klíčových slov}}]
 +[{{:kurz:kwords-distrib.png?direct&400 |Distribuce klíčových slov napříč analyzovaným textem}}]
 +[{{:kurz:kwords-links.png?direct&400 |Vzájemné vazby mezi klíčovými slovy (keyword links)}}]
 +[{{:kurz:kwords-comp.png?direct&400| Srovnání několika projevů -- multianalýza}}]
 +
 +===== Jak citovat KWords =====
 +
 +<WRAP round tip 80%>
 +Horký, V. – Vondřička, P. – Cvrček, V.: KWords (ver. 2). FF UK. Praha 2023. Dostupný z WWW: <http://kwords.korpus.cz>.
 +</WRAP>
  
 +==== Předchozí verze ====
  
 +<WRAP round tip 80%>
 +Cvrček, V. – Vondřička, P.: KWords (ver. 1). FF UK. Praha 2013. Dostupný z WWW: <http://kwords.korpus.cz/legacy>.
 +</WRAP>
 ==== Související odkazy ==== ==== Související odkazy ====
  
 <WRAP round box 49%> <WRAP round box 49%>
-[[manual:menu:index|Rozhraní KonText]] • [[manual:syd|SyD]] • [[manual:morfio|Morfio]] • [[pojmy:korpusovy_manazer|Korpusový manažer]] • [[pojmy:nastroje|Korpusové nástroje]]+[[manualy:kontext:index|Rozhraní KonText]] • [[syd|SyD]] • [[morfio|Morfio]] • [[treq|Treq]] • [[pojmy:korpusovy_manazer|Korpusový manažer]] • [[pojmy:nastroje|Korpusové nástroje]]
 </WRAP> </WRAP>