Application of lemmatization and summarization methods in topic identification module for large scale language modeling data filtering

Date issued

2012

Journal Title

Journal ISSN

Volume Title

Publisher

Springer

Abstract

Příspěvek prezentuje pokusy s modulem identifikace tématu, který je součástí komplexního systému pro získávání a ukládání velkých objemů textových dat. Modul identifikace tématu zpracovává získaná data a přiřadí jim téma z definované hierarchie témat . Hierarchie témat je poměrně rozsáhlá - obsahuje asi 450 témat a kategorií témat. Může se snadno stát, že pro některé úzce zaměřené téma není dostatek dat pro trénování identifikace tématu. Bylo ukázáno, že lemmatizace zlepšuje výsledky při práci s řídkými daty v oblasti vyhledávání informací. Proto je v článku studován vliv lemmatizace na výsledky identifikace tématu. Na druhé straně, protože se systém používá pro zpracování velkého množství dat, byla implementována metoda sumarizace a vliv použití pouze shrnutí článku na přesnost identifikace tématu je studován.

Description

Subject(s)

identifikace tématu, lemmatizace, sumarizace, jazykové modelování

Citation

SKORKOVSKÁ, Lucie. Application of lemmatization and summarization methods in topic identification module for large scale language modeling data filtering. In: Text, speech and dialogue. Berlin: Springer, 2012, p. 191-198. (Lecture notes in computer science; 7499). ISBN 978-3-642-32789-6.

Collections

OPEN License Selector