English Dataset For Automatic Forum Extraction

dc.contributor.authorSido, Jakub
dc.contributor.authorKonopík, Miloslav
dc.contributor.authorPražák, Ondřej
dc.date.accessioned2020-03-23T11:00:24Z
dc.date.available2020-03-23T11:00:24Z
dc.date.issued2019
dc.description.abstractTento článek popisuje proces sbírání a tvorby anglického datasetu pro trénování algoritmů pro automatickou extrakci informací z diskuzních fór. Dataset se skládá z ručně označených příspěvků skládajících se z jména uživatele, data publikování, textu příspěvku a citací/reakcí. Dataset obsahuje 79 rozdílných webových serverů s minimálně 500 stránek z každého. Každá webová stránka se skládá z struktury HTML tagů. Také jsou popsány prvotní experimenty se základními architekturami neuronových sítí a SVM.cs
dc.description.abstractThis paper describes the process of collecting, maintaining and exploiting an English dataset of web discussions. The dataset consists of many web discussions with hand-annotated posts in the context of a tree structure of a web page. Each post consists of username, date, text, and citations used by its author. The dataset contains 79 different websites with at least 500 pages from each. Each web page consists of a tree structure of HTML tags with texts taken from selected web pages. In the paper, we also describe algorithms trained on the dataset. The algorithms employ basic architectures (such as a bag of words with an SVM classifier and an LSTM network) to set a baseline for the dataset.en
dc.format7 s.cs
dc.format.mimetypeapplication/pdf
dc.identifier.citationSIDO, J., KONOPÍK, M., PRAŽÁK, O. English Dataset For Automatic Forum Extraction. Computación y Sistemas, 2019, roč. 23, č. 3, s. 765-771. ISSN 1405-5546.en
dc.identifier.document-number489136900014
dc.identifier.doi10.13053/CyS-23-3-3259
dc.identifier.issn1405-5546
dc.identifier.obd43927031
dc.identifier.uri2-s2.0-85076633364
dc.identifier.urihttp://hdl.handle.net/11025/36716
dc.language.isoenen
dc.project.IDSGS-2019-018/Zpracov heterogenn dat a jejich specializovanplikacecs
dc.project.IDEF17_048/0007267/InteCom: VaV inteligentních komponent pokročilých technologií pro plzeňskou metropolitní oblastcs
dc.publisherInstituto Politecnico Nacionalit
dc.relation.ispartofseriesComputación y Sistemasen
dc.rightsPlný text je přístupný v rámci univerzity přihlášeným uživatelům.cs
dc.rights© Instituto Politecnico Nacionalen
dc.rights.accessrestrictedAccessen
dc.subjectExtrakce informacícs
dc.subjectwebové diskuzecs
dc.subject.translatedInformation retrievalen
dc.subject.translatedweb discussionen
dc.titleEnglish Dataset For Automatic Forum Extractionen
dc.title.alternativeAnglický dataset pro automatickou extrakci diskuzních fórcs
dc.typečlánekcs
dc.typearticleen
dc.type.statusPeer-revieweden
dc.type.versionpublishedVersionen

Files