AplikaceAplikace
Nastavení

Rozdíly

Zde můžete vidět rozdíly mezi vybranou verzí a aktuální verzí dané stránky.

Odkaz na výstup diff

Obě strany předchozí revizePředchozí verze
Následující verze
Předchozí verze
seznamy:mwe [2026/03/09 01:27] – [3. pozice] hanaskoumalovaseznamy:mwe [2026/08/18 13:41] (aktuální) jankrivan
Řádek 1: Řádek 1:
 ====== Značkování víceslovných lexikálních jednotek ====== ====== Značkování víceslovných lexikálních jednotek ======
  
-Počínaje korpusem [[cnk:syn:verze14|SYNv14]] označujeme v korpusech víceslovné lexikální jednotky (VLJ) novým značením propojeným s [[https://db.korpus.cz/search/_lemur_simple|databází VLJ LEMUR]] (**L**exicon of **Mu**ltiword Exp**r**essions). Toto značkování je zatím spuštěno v pilotní verzi a navazuje na dosavadní [[seznamy:frazemy|značkování frazémů nástrojem FRANTA]].+Počínaje korpusem [[cnk:syn:verze14|SYNv14]] a korpusem [[cnk:synr25]] označujeme v korpusech víceslovné lexikální jednotky (VLJ) novým značením propojeným s [[https://db.korpus.cz/search/_lemur_simple|databází VLJ LEMUR]] (**L**exicon of **Mu**ltiword Exp**r**essions). Toto značkování je zatím spuštěno v pilotní verzi a navazuje na dosavadní [[seznamy:frazemy|značkování frazémů nástrojem FRANTA]].
  
 <WRAP round important 70%> <WRAP round important 70%>
-Automatické značkování VLJ nese některé **nedostatky**. Především si nečiní nárok na úplnost, řada výrazů tedy ve slovníku není zahrnutá. Dále je potřeba počítat s tím, že některé výrazy nemusejí být vůbec nalezeny (například proto, že nebyla detekována jejich nestandardní realizace), nebo může být naopak jako frazém označeno užití v doslovném významu (např. //Kocour si líže rány, které mu způsobil sousedův pes.//).+Automatické značkování VLJ nese některé **nedostatky**. Především si nečiní nárok na úplnost, řada výrazů tedy ve slovníku není zahrnutá. Dále je potřeba počítat s tím, že některé výrazy nemusejí být vůbec nalezeny (například proto, že nebyla detekována jejich nestandardní realizace), nebo může být naopak jako VLJ označeno užití v doslovném významu (např. //Kocour si líže rány, které mu způsobil sousedův pes.//).
 </WRAP> </WRAP>
  
Řádek 17: Řádek 17:
 **mwe_tag** (multi-word expression tag): poziční [[pojmy:tag|tag]] víceslovné jednotky s deseti pozicemi.  **mwe_tag** (multi-word expression tag): poziční [[pojmy:tag|tag]] víceslovné jednotky s deseti pozicemi. 
  
-==== 1. pozice ====+==== 1. pozice: typ užití ====
  
 Na první pozici označujeme typ užití VLJ (např. přísloví, citace, slovesný frazém).  Na první pozici označujeme typ užití VLJ (např. přísloví, citace, slovesný frazém). 
Řádek 37: Řádek 37:
 | **v** | slovesný frazém | vidět_na_vlastní_oči | | **v** | slovesný frazém | vidět_na_vlastní_oči |
  
-==== 2. pozice ====+==== 2. pozice: syntaktický typ ====
  
 Druhá pozice rozlišuje syntaktický typ dané VLJ (např. jmenná fráze, klauze, souvětí). Přesněji jde o syntaktický typ konkrétního dokladu dané VLJ, např. pod mwe_lemmatem ''vytřeštit_oči'' (typ **v**) jsou obsaženy i doklady //vytřeštěné oči// a //třeštící oči// (typ **a**). Druhá pozice rozlišuje syntaktický typ dané VLJ (např. jmenná fráze, klauze, souvětí). Přesněji jde o syntaktický typ konkrétního dokladu dané VLJ, např. pod mwe_lemmatem ''vytřeštit_oči'' (typ **v**) jsou obsaženy i doklady //vytřeštěné oči// a //třeštící oči// (typ **a**).
Řádek 55: Řádek 55:
 | **v** | slovesná fráze plnovýznamová | lapat_po_dechu | | **v** | slovesná fráze plnovýznamová | lapat_po_dechu |
  
-==== 3. pozice ====+==== 3. pozice: syntaktická transformace ====
  
 Je-li označená VLJ výsledkem syntaktické transformace (např. pasivizace či nominalizace) základní varianty VLJ, označujeme to na třetí pozici. Je-li označená VLJ výsledkem syntaktické transformace (např. pasivizace či nominalizace) základní varianty VLJ, označujeme to na třetí pozici.
Řádek 69: Řádek 69:
 | **L** | verbální adjektivum odvozené od tvaru minulého aktivního příčestí | jsme na sebe zvyklí (zvyknout_si_na_sebe) |  | **L** | verbální adjektivum odvozené od tvaru minulého aktivního příčestí | jsme na sebe zvyklí (zvyknout_si_na_sebe) | 
 | **T** | verbální adjektivum zakončené na -telný/-itelný | viditelný pouhým okem (vidět_pouhým_okem) |  | **T** | verbální adjektivum zakončené na -telný/-itelný | viditelný pouhým okem (vidět_pouhým_okem) | 
-| **V** | jmenná fráze se vztažnou větou | jablko, které nepadlo daleko od stromu (jablko nepadá daleko od stromu) | +| **V** | jmenná fráze se vztažnou větou | jablko, které nepadlo daleko od stromu (jablko_nepadá_daleko_od_stromu) | 
  
-==== Další pozice ====+==== 4.–9. pozice: idiomaticita ====
  
-Pozice 4-zůstávají zatím nevyužité (hodnota **_**)protože dané vlastnosti VLJ nejsou v databázi LEMUR dostatečně spolehlivě anotované.+Na pozicích 4se rozlišují různé typy idiomaticity, pokud se jimi daná VLJ vyznačuje. Vycházíme z Baldwinovy klasifikace idiomatiticy((Baldwin, T. & Kim, S. N. (2010): Multiword Expressions. In: Indurkhya, N. & Damerau, F. J. (eds.) //Handbook of Natural Language Processing// (2nd edition), 267–292. Boca Raton: CRC Press.)) a rozlišujeme idiomatiticu lexikální, morfologickou, syntaktickou, sémantickou, pragmatickou a statistickou. Pokud daná VLJ určitý typ idiomaticity nemá, je hodnota na příslušné pozici "-"
 + 
 +**4. pozice** vyjadřuje **lexikální** idiomaticitu. 
 + 
 +^ 4. pozice ^ význam ^ přiklad víceslovného lemmatu |  
 +| **l** | lexikální idiomaticita | jáma_lvová |  
 +| **k** | makaronská struktura | per_hubam | 
 + 
 +**5. pozice** vyjadřuje **morfologickou** idiomaticitu. 
 + 
 +^ 5. pozice ^ význam ^ přiklad víceslovného lemmatu |  
 +| **z** | alespoň jedno slovo je morfologicky idiomatické | podle_nosa_poznáš_kosa |  
 + 
 +**6. pozice** vyjadřuje **syntaktickou** idiomaticitu. 
 + 
 +^ 6. pozice ^ význam ^ přiklad víceslovného lemmatu |  
 +| **a** | anakolut | kdo_po_tobě_kamenem,_ty_po_něm_chlebem |  
 +| **t** | atrakce | padni_komu_padni| 
 +| **v** | zvláštní valence | osud_tomu_chtěl|  
 +| **p** | apoziopeze | | 
 +| **e** | elipsa | jeden_o_koze,_druhý_o_voze|  
 +| **s** | neobvyklý pořádek slov | liška_podšitá| 
 +| **o** | jiné typy syntaktické idiomaticity | člověče_nešťastná |  
 + 
 +**7. pozice** vyjadřuje **sémantickou** idiomaticitu, již chápeme jako stupeň kompozicionality dané VLJ
 + 
 +^ 7. pozice ^ význam ^ přiklad víceslovného lemmatu |  
 +| **n** | nekompozicionální | bláhová_naděje |  
 +| **z** | zřídka kompozicionální | omlátit_o_hlavu | 
 +| **c** | často kompozicionální | upadnout_na_nos |  
 +| **-** | vždy kompozicionální, tj. VLJ není sémanticky idiomatická | ublížení_na_zdraví | 
 + 
 +**8. pozice** vyjadřuje **pragmatickou** idiomaticitu. 
 + 
 +^ 8. pozice ^ význam ^ přiklad víceslovného lemmatu |  
 +| **p** | pragmaticky idiomatické | smím_prosit |  
 + 
 +**9. pozice** vyjadřuje **statistickou** idiomaticitu, tj. VLJ nevyjadřuje žádný jiný typ idiomaticity. Výraz odpovídá termínu nebo kolokaci, tedy frekventovanému souvýskytu dvou lexémů s plně kompozicionální sémantikou a pravidelnou, gramatickou morfologií a syntaxí. 
 + 
 +^ 9. pozice ^ význam ^ přiklad víceslovného lemmatu |  
 +| **s** | statisticky idiomatické | diferenciální_rovnice \\ v_dnešní_době |  
 + 
 +V korpusu SYNv14 nejsou na těchto pozicích žádné hodnoty. 
 + 
 +==== 10pozice  ====
  
 Poslední, **10. pozice**  je spíše technického rázu, právě jeden token z víceslovného výrazu je označen **C**, aby bylo možné při počítání frekvencí počítat každou VLJ jen jednou, ne podle počtu jejích tokenů. Poslední, **10. pozice**  je spíše technického rázu, právě jeden token z víceslovného výrazu je označen **C**, aby bylo možné při počítání frekvencí počítat každou VLJ jen jednou, ne podle počtu jejích tokenů.