Czech Historical Named Entity Corpus v 1.0

Hubková, Helena

Czech Historical Named Entity Corpus v 1.0

Date issued

2020

Authors

Hubková, Helena

Král, Pavel

Pettersson, Eva

Publisher

European Language Resources Association (ELRA)

Abstract

Vzhledem k tomu, že počet digitalizovaných archivních dokumentů roste velmi rychle, rozpoznávání pojmenovaných entit (NER) v historických dokumentech se stalo velmi důležitým pro extrakci informací a dolování dat. K této úloze je zapotřebí anotovaný korpus, který pro češtinu dosud chyběl. V tomto článku představujeme novou anotovanou datovou kolekci pro historické NER, která složena z českých historických periodik. Tato sada je volně k dispozici pro výzkumné účely na adrese http://chnec.kiv.zcu.cz/. Definovali jsme relevantní typy pojmenovaných entit a vytvořili anotační příručku. Dále jsme provedli několik experimentů s využitím rekurentních neuronových sítí, abychom ukázali základní výsledky na této datové sadě. Experimentovali jsme s náhodně inicializovanými a statickými i dynamickými fastText slovními vektory. Dosáhli jsme F1 skóre 0,73 s obousměrným LSTM modelem a statickými fastText slovními vektory.

Subject(s)

historická čeština, historický korpus pojmenovaných enti, LSTM, rozpoznávání pojmenovaných entit, neuronové sítě

Citation

HUBKOVÁ, H. KRÁL, P. PETTERSSON, E. Czech Historical Named Entity Corpus v 1.0. In: Proceedings of the 12th Language Resources and Evaluation Conference. Paris: European Language Resources Association (ELRA), 2020. s. 4458-4465. ISBN 979-10-95546-34-4.