cnk:intercorp:verze16 - Příručka ČNK

Obsah

Korpus InterCorp verze 16

Korpus InterCorp verze 16

Název		čeština jádro	čeština kolekce	cizí jazyky jádro	cizí jazyky kolekce
Pozice	Počet tokenů	154 512 254	363 685 460	464 653 933	5 840 602 221
Pozice	Počet slovních tvarů	124 679 582	272 862 335	386 728 679	4 505 550 764
Struktury	Počet dokumentů	1 812	33	4 643	338
	Počet textů	1 812	162 612	4 643	2 662 665
	Počet vět	10 691 339	50 729 559	28 684 678	790 046 584
Další informace	referenční	ANO
	reprezentativní	NE (různé textové typy)
	rok zveřejnění	2023
	cizích jazyků	61
	tagovaných jazyků	27
	jazyky s lemmaty	25

Přístup k textům

Po registraci na stránce Prohlášení uživatele korpusů ÚČNK lze korpus prohledávat přes webové rozhraní. Registrace platí pro všechny veřejně přístupné korpusy ÚČNK. Máte-li uživatelské jméno a heslo k české části Českého národního korpusu, další registraci pro paralelní korpus nepotřebujete.

InterCorp je přístupný přes běžný webový prohlížeč z jednotného vyhledávacího rozhraní KonText pomocí speciálního dotazovacího formuláře pro paralelní korpusy.

Texty z korpusu InterCorp lze získat po podpisu licenčního ujednání pro neziskové účely také v podobě dvojjazyčných souborů náhodně seřazených dvojic vět. Zájemci se mohou obrátit na Alexandra Rosena.

Obvykle jednou ročně vychází nová verze InterCorpu. V každé nové verzi roste objem textů, případně i počet jazyků a rozsah anotace. Od verze 6 dál jsou všechny předchozí verze stále dostupné.

Obsah korpusu

Jádrem korpusu InterCorp jsou ručně zarovnané, převážně beletristické texty. Kromě toho korpus obsahuje také nabídku automaticky zpracovaných textů, tzv. kolekce. Ve verzi 16 jsou k dispozici tyto kolekce:

publistické články a zpravodajství z webových stránek Project Syndicate a VoxEurop (dříve PressEurop)
právní texty Evropské unie z korpusu Acquis Communautaire
zápisy jednání Evropského parlamentu z let 2007–2011 z korpusu Europarl
filmové titulky z databáze OpenSubtitles
překlady Bible

Tyto texty jsou zarovnány jen automaticky, v konkordancích tedy může být více vět, které si navzájem neodpovídají. Kolekce také neobsahují všechny texty z původního zdroje, např. ty, které nemají český protějšek. Některé texty z korpusů Acquis Communautaire a Europarl byly rovněž částečně opraveny nebo vytříděny, takže se mohou ve srovnání s původním zdrojem lišit podobou i rozsahem. Podobně byla zredukována i databáze OpenSubtitles, kde jsme navíc u každého titulu převzali z více verzí překladu jen jednu. Zato byly doplněny některé metainformace, které v původním zdroji chyběly, ale daly se zjistit z kontextu nebo jiných zdrojů. Došlo rovněž k rozdělení Syndicate a PressEurop na jednotlivé ročníky, čímž se zvýšil počet dokumentů v kolekcích.

Každý cizojazyčný text má v korpusu svou českou verzi. Čeština je tedy tzv. pivot, česká verze textu (originál nebo překlad) je zarovnána s jednou nebo více verzemi cizojazyčnými. Celkový rozsah zpřístupněné části korpusu ve verzi 16 z roku 2023 činí v zarovnaných cizojazyčných textech 387 milionů slov v jádru a 4 506 milionů slov v kolekcích. V českých textech je v jádru 125 a v kolekcích 273 milionů slov (viz historie verzí). Rozložení textů v rámci jádra a v jednotlivých kolekcích je znázorněno na následujících grafech. Čísla v grafech ukazují velikost v milionech slov.

Skladba korpusu podle jednotlivých jazyků – jádro i kolekce

Skladba korpusu podle jednotlivých jazyků – jádro

Skladba korpusu podle jednotlivých jazyků – kolekce

Velikost korpusu v tisících slov

Zkratka	Jazyk	Jádro	Syndicate	Presseurop	Acquis	Europarl	Subtitles	Bible	Celkem
af	afrikánština	0	0	0	0	0	136	0	136
ar	arabština	34	384	0	0	0	126 157	0	126 576
be	běloruština	7 131	0	0	0	0	0	0	7 131
bg	bulharština	7 068	0	0	13 577	9 083	165 092	0	194 820
bn	bengálština	0	0	0	0	0	1 554	0	1 554
br	bretonština	0	0	0	0	0	98	0	98
bs	bosenština	0	0	0	0	0	58 758	0	58 758
ca	katalánština	10 112	0	0	0	0	2 735	736	13 582
cs	čeština	124 680	4 717	2 312	19 214	12 917	233 139	563	397 542
da	dánština	9 548	0	0	20 313	13 916	71 825	657	116 259
de	němčina	40 679	5 067	2 483	20 610	13 089	98 566	724	181 219
el	řečtina	0	0	0	23 853	15 404	162 561	0	201 818
en	angličtina	42 395	5 273	2 670	22 902	15 576	280 335	730	369 882
eo	esperanto	0	0	0	0	0	226	0	226
es	španělština	30 661	6 074	2 859	26 262	16 249	223 134	0	305 240
et	estonština	79	0	0	14 896	10 899	54 514	0	80 388
eu	baskičtina	0	0	0	0	0	3 022	0	3 022
fa	perština	0	0	0	0	0	33 167	0	33 167
fi	finština	6 959	0	0	15 269	10 108	90 471	543	123 349
fr	francouzština	24 361	5 896	3 046	26 200	17 179	181 433	764	258 879
gl	galicijština	0	0	0	0	0	623	0	623
he	hebrejština	0	0	0	0	0	130 143	0	130 143
hi	hindština	409	0	0	0	0	432	0	841
hr	chorvatština	24 529	0	0	0	0	137 966	571	163 066
hs	hornolužická srbština	466	0	0	0	0	0	0	466
hu	maďarština	6 921	8	0	17 852	12 198	141 691	0	178 670
hy	arménština	0	0	0	0	0	24	0	24
id	indonéština	0	0	0	0	0	38 343	0	38 343
is	islandština	0	0	0	0	0	7 375	0	7 375
it	italština	18 086	1 389	2 747	23 771	15 494	163 622	684	225 793
ja	japonština	3 818	2	0	0	0	12 485	0	16 305
ka	gruzínština	0	0	0	0	0	889	0	889
kk	kazaština	0	0	0	0	0	14	0	14
ko	korejština	0	0	0	0	0	5 980	0	5 980
lt	litevština	696	0	0	17 316	11 213	5 269	471	34 964
lv	lotyština	3 636	0	0	17 533	11 682	2 053	537	35 441
mk	makedonština	8 881	0	0	0	0	15 595	0	24 476
ml	malajámština	0	0	0	0	0	1 281	0	1 281
ms	malajština	0	0	0	0	0	7 939	0	7 939
mt	maltština	0	0	0	13 935	0	0	0	13 935
nl	nizozemština	18 782	812	2 953	23 416	15 558	170 979	717	233 217
no	norština	8 221	0	0	0	0	39 807	724	48 752
pl	polština	28 597	0	2 380	19 604	12 817	169 498	583	233 480
pt	portugalština	7 285	739	2 782	24 598	15 193	229 515	706	280 818
rn	romština	14	0	0	0	0	0	0	14
ro	rumunština	4 219	0	2 738	8 092	9 446	212 396	0	236 890
ru	ruština	12 387	4 302	0	0	0	104 609	565	121 864
si	sinhálština	0	0	0	0	0	2 346	0	2 346
sk	slovenština	8 586	0	0	18 399	12 727	34 581	561	74 854
sl	slovinština	4 636	0	0	18 515	12 241	83 000	0	118 392
sq	albánština	0	0	0	0	0	9 351	0	9 351
sr	srbština	12 706	0	0	0	0	152 636	0	165 342
sv	švédština	19 740	0	0	19 542	13 784	81 548	638	135 252
ta	tamilština	0	0	0	0	0	104	0	104
te	telugština	0	0	0	0	0	96	0	96
th	thajština	0	0	0	0	0	5 660	0	5 660
tl	tagalština	0	0	0	0	0	38	0	38
tr	turečtina	0	0	0	0	0	149 892	0	149 892
uk	ukrajinština	14 849	0	0	0	0	2 938	596	18 382
ur	urdština	0	0	0	0	0	158	0	158
vi	vietnamština	0	0	0	0	0	22 298	0	22 298
zh	čínština	238	838	0	0	0	71 331	0	72 407
CELKEM		511 408	35 503	26 971	425 670	276 772	4 001 428	12 069	5 289 821

Pozn.: U českých textů se počítají slova jen jednou za každý text, i když má více cizojazyčných protějšků.

Počet textů v jádru korpusu

Zkratka	Jazyk	Počet textů	z toho originály
ar	arabština	3	1
be	běloruština	108	14
bg	bulharština	87	19
ca	katalánština	92	1
cs	čeština	1 812	368
da	dánština	93	9
de	němčina	471	163
en	angličtina	422	271
es	španělština	355	142
et	estonština	1	0
fi	finština	112	36
fr	francouzština	277	126
hi	hindština	7	2
hr	chorvatština	324	37
hs	hornolužická srbština	13	5
hu	maďarština	89	1
it	italština	171	26
ja	japonština	35	15
lt	litevština	23	4
lv	lotyština	73	15
mk	makedonština	108	4
nl	nizozemština	215	52
no	norština	102	23
pl	polština	348	54
pt	portugalština	87	24
rn	romština	2	2
ro	rumunština	45	5
ru	ruština	160	37
sk	slovenština	165	62
sl	slovinština	73	25
sr	srbština	148	13
sv	švédština	232	101
uk	ukrajinština	199	8
zh	čínština	3	3
CELKEM		6 455	1 668

Morfosyntaktická anotace

Texty v níže uvedených jazycích jsou opatřeny morfologickou anotací. Formát a často i význam kategorií zakódovaných do morfologických značek se liší od češtiny. U každého jazyka proto uvádíme i odkaz na popis příslušné sady značek. Popis značek je dostupný i z vyhledávacího rozhraní KonText, když jako typ dotazu zvolíte CQL. Někdy odkazujeme na stručný popis sady značek daného jazyka na stránkách Sketch Engine.

Jazyk	Značky	Lemmata	Stručný popis	Podrobný popis	Značky v korpusu	Nástroj
angličtina	✔	✔	anglicky	anglicky + dodatky	ukázat	TreeTagger
běloruština	✔	✔	anglicky****)	anglicky****)	ukázat	UDPipe
bulharština	✔	✔	anglicky	anglicky	ukázat	TreeTagger
čeština	✔	✔	česky a anglicky	anglicky	ukázat	Morče
čínština	✔		anglicky	anglicky	ukázat	ZPar v0.7.5
estonština	✔	✔	estonsky a anglicky		ukázat	TreeTagger
finština	✔	✔	anglicky*)	anglicky*)	ukázat	OMorFi +HunPOS
francouzština	✔	✔	anglicky		ukázat	TreeTagger
chorvatština	✔	✔	anglicky	anglicky	ukázat	ReLDI Tagger
islandština	✔	✔	anglicky	anglicky	ukázat	IceStagger
italština	✔	✔	anglicky		ukázat	TreeTagger
japonština	✔	✔	anglicky		ukázat	MeCab + Unidic
katalánština	✔	✔	anglicky		ukázat	TreeTagger
lotyština	✔	✔	lotyšsky		ukázat	LVTagger
maďarština	✔			anglicky	ukázat	RFTagger
němčina	✔	✔	anglicky **)	německy	ukázat	RFTagger
nizozemština	✔	✔	anglicky		ukázat	TreeTagger
norština	✔	✔	anglicky****)	anglicky****)	ukázat	UDPipe
polština	✔	✔	anglicky a polsky	anglicky	ukázat	Morfeusz, KRNNT
portugalština	✔	✔	španělsky		ukázat	TreeTagger
ruština	✔	✔	anglicky	anglicky ***)	ukázat	TreeTagger
slovenština	✔	✔	slovensky anglicky	slovensky	ukázat	Radovan Garabík, Morče
slovinština	✔	✔		anglicky	ukázat	ReLDI Tagger
srbština	✔	✔	anglicky	anglicky	ukázat	ReLDI Tagger
španělština	✔	✔	anglicky		ukázat	TreeTagger
švédština	✔	✔	švédsky a anglicky		ukázat	Stagger
ukrajinština	✔	✔	anglicky****)	anglicky****)	ukázat	UDPipe

*) Morfologické značky jsou v korpusu uvedeny v kondenzované podobě, např. V:Sg:Nom:Act:PrfPrc:Pos odpovídá zápisu s atributy [POS=V] [NUM=SG] [CASE=NOM] [VOICE=ACT] [PCP=PRFPRC] [CMP=POS]. Podobně Pron:Pers:Sg:Ade:Up odpovídá zápisu [POS=PRON] [SUBCAT:PERS] [NUM:SG] [CASE=ADE] [CASECHANGE=UP].

**) Uvnitř jedné morfologické značky používáme jako oddělovač jednotlivých kategorií dvojtečku místo tečky, tedy např. ADJA:Pos:Nom:Sg:Fem.

***) Značky v korpusu někdy neodpovídají značkám uvedeným v podrobném popisu. V korpusu se zanedbávají některé morfologické kategorie, např. zájmena jsou vždy označkována jen jako „P-“. Všechny značky, tak jak se užívají v korpusu, jsou uvedeny ve stručném popisu.

****) Značka je uvedena ve formátu UD (Universal Dependencies), jednotlivé části značky jsou odděleny svislítkem (|), např. tvar школы v genitivu singuláru je značkován takto: NOUN|Animacy=Inan|Case=Gen|Gender=Fem|Number=Sing. Dotaz lze formulovat tak jako u jiných jazyků, tedy na řetězec znaků, např. [tag="NOUN.*Case=Gen\|Gender=Fem.*"] nebo lze specifikovat jednotlivé části značky zvlášť, tedy např. [tag="Case=Gen" & tag="NOUN" & tag="Gender=Fem"] (na pořadí kategorií nezáleží). Výsledek je v obou případech stejný.

Rozdíly mezi formátem značek v dokumentaci a v korpusu jsou i u některých jiných jazyků. Před zadáním dotazu na značku si formát značky prosím ověřte. Můžete využít třeba výpisy značek z korpusu ve výše uvedené tabulce – viz sloupec Značky v korpusu. Nebo na stránce s výsledky libovolného dotazu zaškrtněte v menu Zobrazení/Korpusová nastavení… mezi Pozičními atributy volbu tag a v Možnostech zobrazení vyberte pro každý token.

U textů se značkami, případně lemmaty, mohou přímočaře formulované dotazy na spřežková slova zůstat bez odpovědi. To se týká například anglických tvarů can't nebo I'm, které tagger rozdělí na dvě slova (ca+n't a I+'m) s odpovídajícími lemmaty a značkami. Podobně je tomu i s polskými tvary typu byłam nebo gdybyś (rozděleno na była+m a gdyby+ś). Je třeba počítat i s chybným rozdělením: gdzie+ś za Wisłą. Dotaz na celou spřežku je nutné zadat jako Fráze a části spřežky oddělit mezerou. Lemmatem a značkou jsou opatřeny jen části spřežky.

Morfologické značky obsahující znaky, které mají v regulárních výrazech zvláštní význam, např. $ v anglické značce wp$, je třeba v dotazech zadávat za zpětné lomítko, tedy např. takto: tag="wp\$".

Strukturní atributy

Struktura	Atribut	Popis	Možné hodnoty
doc	doc.id	identifikátor dokumentu	příjmení_autora-zkrácený_název_textu / _ACQUIS / _EUROPARL / _PRESSEUROP_ročník / _SUBTITLES / _SYNDICATE_ročník / _OT / _NT
text	text.id	identifikace textu	příjmení_autora-zkrácený_název_textu:0 / _ACQUIS:číslo / _EUROPARL:číslo / _PRESSEUROP:číslo / _SUBTITLES:číslo / _SYNDICATE_ročník:název / _OT:kniha / _NT:kniha
	text.author	autor textu	příjmení, jméno
	text.title	úplný název textu	text
	text.lang	jazyk textu	ar / be / bg / ca / cs / da / de / el / en / es / et / fi / fr / he / hi / hr / hu / is / it / ja / lt / lv / mk / ms / mt / nb / nl / no / pl / pt / rn / ro / ru / sk / sl / sq / sr / sv / sy / tr / uk / vi / zh
	text.version	verze textu	číslo
	text.group	jádro/kolekce	Core / Acquis / Europarl / PressEurop / Subtitles / Syndicate / Bible
	text.publisher	vydavatel	text
	text.pubplace	místo vydání	text
	text.pubDateYear	rok vydání	číslo
	text.pubDateMonth	měsíc vydání	číslo
	text.origyear	rok vytvoření originálu	číslo
	text.isbn	ISBN	číslo
	text.txtype	typ textu	discussions - transcripts / drama / fiction / journalism - commentaries / journalism - news / legal texts / nonfiction / other / poetry / subtitles / religious
	text.comment	poznámka	text
	text.original	originální verze?	Yes / No
	text.srclang	jazyk originálu	ar / as / az / be / bg / bl / bn / bo / bs / bt / ca / cr / cs / ct / cz / da / de / dk / eb / el / en / es / et / eu / fa / fi / fr / ga / gr / he / hi / hr / hu / hy / id / ie / is / it / ja / ka / ko / ku / lt / lv / mk / mn / ms / mt / my / ni / nl / no / pl / po / ps / pt / rm / rn / ro / ru / se / sk / sl / sq / sr / sv / ta / th / ti / tl / tr / tu / uk / un / ur / vi / zh
	text.translator	překladatel	příjmení, jméno
	text.transsex	pohlaví překladatele	F / M
	text.authsex	pohlaví autora	F / M
	text.transcomment	poznámka k překladu	text
	text.collectiontitle	název kolekce	text
	text.volume	číslo svazku	číslo
	text.pages	počet stran	číslo
	text.lang_var	varieta jazyka	de-AT / de-CH / de-DE / en-AU / en-CA / en-GB / en-UM / en-US / es-ES / es-MX / es-PE / fr-BE / fr-FR / it-CH / it-IT / nl-BE / nl-NL / nn-NO / nb-NO / pt-BR / pt-PT / sr-RS
	text.wordcount	počet slov	číslo
div	div.id	identifikátor oddílu (Bible)	_NT / _OT:kapitola
	div.type	typ oddílu (kapitola)	chapter
p	p.id	identifikátor odstavce	doc:text:div:par
s	s.id	identifikátor věty	doc:text:div:par:sent
hi	hi.rend	řez písma	italic / bold / bold italic
lb	lb.id	identifikátor verše (Bible)	book:chapter:verse

Poděkování

Děkujeme za možnost využívat následující texty a software:

Texty:

za možnost zařadit do korpusu nejnovější (13. opravené) vydání Českého ekumenického překladu Bible z roku 2016 děkujeme České biblické společnosti, zvláště Petru Fryšovi
beletristické texty v řadě slovanských i jiných jazyků z korpusu ASPAC – Amsterdam Slavic Parallel Aligned Corpus – zvláštní poděkování patří Adrianu Barentsenovi
publicistické texty ve více jazycích z webových stránek Project Syndicate
publicistické texty ve více jazycích ze serveru VoxEurop
právnické texty v jazycích EU z korpusu JRC-ACQUIS
jednání Evropského parlamentu z korpusu EuroParl
slovensko-české konkordance ze Slovenského národního korpusu
povídky ve více jazycích z projektu Můj rok 1989 z Goethe Institutu
za více textů v česko-litevské části korpusu a za práci Jiřího Levého Umění překladu ve více jazycích vděčíme Patricku Cornessovi
román George Orwella 1984 ve více jazycích z korpusu Multext-East
ukrajinské a polské texty z korpusu PolUkr
norské texty z nakladatelství Forlaget Oktober
filmové titulky z databáze Open Subtitles

Předzpracování:

editor paralelních textů InterText (autor Pavel Vondřička)
zarovnávač Hunalign
větný segmentátor pro češtinu (autor Pavel Květoň)
větný segmentátor pro norštinu (autoři Jarle Ebeling a Pavel Vondřička)
větný segmentátor Punkt pro všechny ostatní jazyky ze sady Natural Language Toolkit

Značkovače / lemmatizátory:

MorfFlex, Morče a LanGr pro češtinu
TreeTagger pro angličtinu, bulharštinu, estonštinu, francouzštinu, italštinu, katalánštinu, nizozemštinu, portugalštinu (s poděkováním Pablu Gamallovi), ruštinu a španělštinu
Morfeusz a KRNNT pro polštinu
HunPOS pro finštinu a další jazyky
tagger pro slovenštinu (s poděkováním Radovanu Garabíkovi)
totale pro slovinštinu (do v.11, s poděkováním Tomaži Erjavcovi)
RFTagger pro němčinu a maďarštinu
OMorFi pro finštinu (s poděkováním Filipu Ginterovi)
Stagger a IceStagger pro švédštinu a islandštinu (s poděkováním Robertu Östlingovi)
RelDI tagger pro chorvatštinu, srbštinu¹⁾ a slovinštinu²⁾ (s poděkováním Nikolovi Ljubešićovi)
LVTagger pro lotyštinu (s poděkováním Pēterisi Ņikiforovsovi a Michalu Škrabalovi)
UD Pipe pro běloruštinu a ukrajinštinu (s poděkováním Bohdanu Moskalevskému)
MeCab a Unidic pro japonštinu (s poděkováním Adamovi Nohejlovi)
ZPar pro čínštinu (s poděkováním Vlastimilu Dobečkovi)

Známé problémy

Ve finštině, polštině a slovenštině se u některých textů v jádru nezobrazuje hodnota atributu doc.id. Projevuje se to při pokusu zobrazit doc.id v metadatech, strukturách i ve statistice podle dokumentů. Dá se to obejít využitím atributu text.id. V kolekcích (Subtitles, Acquis, etc.) se atribut doc.id ukazuje správně.

Jak citovat

Budeme rádi, když k výsledkům práce, při níž využijete korpus InterCorp, připojíte odkaz na stránky projektu www.intercorp.korpus.cz a k odborným publikacím odkaz na tento článek:

ČERMÁK, F. – ROSEN, A. (2012). The case of InterCorp, a multilingual parallel corpus. International Journal of Corpus Linguistics. Vol. 13, no. 3, p. 411–427 (bibtex, elektronické vydání na serveru ingentaConnect, verze před tiskem).

Seznam další literatury najdete v Repozitáři bibliografických informací založených na ČNK. Každý odkaz na práci využívající InterCorp je vítán, viz podrobnosti.

Při citaci konkrétní části InterCorpu uveďte jako citaci údaj, který je zobrazen v popisu korpusu v rozhraní KonText, např.:

ROSEN, A. – ŠIMČÍK, B. – VAVŘÍN, M. – ZASINA, A. J. Korpus InterCorp – čeština ³⁾, verze 16 ze ?. ?. 2023. Ústav Českého národního korpusu, FF UK, Praha 2023. Dostupné z WWW: https://kontext.korpus.cz/

Viz též

InterCorp • Verze 15 • Verze 13ud • Verze 14 • Verze 13 • Verze 12 • Verze 11 • Verze 10 • Verze 9 • Verze 8 • Verze 7 • Verze 6 • Verze 5 • Verze 4 • Verze 3 • Historie verzí

Původní stránky projektu InterCorp jsou stále zde.

¹⁾

Ljubešić, N., Klubička, F., Željko Agić, and Jazbec, I.-P. (2016). New inflectional lexicons and training corpora for improved morphosyntactic annotation of Croatian and Serbian. In Calzolari, N. et al., editors, Proceedings of the Tenth International Conference on Language Resources and Evaluation (LREC 2016), Paris, France. European Language Resources Association (ELRA).

²⁾

Ljubešić, N. and Erjavec, T. (2016). Corpus vs. lexicon supervision in morphosyntactic tagging: the case of Slovene. In Calzolari, N. et al., editors, Proceedings of the Tenth International Conference on Language Resources and Evaluation (LREC 2016), Paris, France. European Language Resources Association (ELRA).

³⁾

Vložte konkrétní jazyky.

Historie: • pravidla • mapa • verze16