Duomenų tyrybos sistemų galimybių tyrimas įvairių apimčių duomenims analizuoti

Kotryna Paulauskienė; Olga Kurasova

doi:10.15388/Im.2013.0.2052

-

Kotryna Paulauskienė

Olga Kurasova

Publikuota 2013-01-01

https://doi.org/10.15388/Im.2013.0.2052

85-95.pdf

Kaip cituoti

Paulauskienė, K., & Kurasova, O. (2013). Duomenų tyrybos sistemų galimybių tyrimas įvairių apimčių duomenims analizuoti. Information & Media, 65, 85-95. https://doi.org/10.15388/Im.2013.0.2052

Atsisiųsti citatas

Anotacija

Tobulėjant šiuolaikinėms informacinėms ir komunikacinėms technologijoms, sparčiai didėja apdorojamų ir saugomų duomenų kiekiai, todėl duomenų analizės uždavinys tampa vis sudėtingesnis, sunku daryti greitus, efektyvius ir teisingus sprendimus. Duomenų analizei dažnai pasitelkiama duomenų tyryba. Duomenų tyryba – tai procesas, kurio metu iš duomenų išgaunamos naudingos žinios. Duomenims apdoroti bei žinioms išgauti reikalingos duomenų tyrybos sistemos, leidžiančios apdoroti įvairios apimties duomenis. Tyrime siekiama nustatyti, kokios apimties duomenis per priimtiną laiką sugeba apdoroti populiariausios duomenų tyrybos sistemos. Nagrinėjamas ir lyginamas trijose atvirojo kodo duomenų tyrybos sistemose (WEKA, KNIME, ORANGE) įgyvendintų klasifi kavimo ir klasterizavimo algoritmų skaičiavimo laikas, analizuojant skirtingos apimties duomenų aibes. Vertinant sistemas svarbus ne tik algoritmų skaičiavimo laikas, bet ir klasifi kavimo bei klasterizavimo tikslumas, kurį pavyksta pasiekti per tą laiką, todėl straipsnyje pateikiamos ir eksperimentiniuose tyrimuose gauto tikslumo matų reikšmės.

Investigation of the abilities of data mining systems to analyse various volume datasets
Kotryna Paulauskienė, Olga Kurasova

Summary
The aim of the paper is to determine what volume of data the popular data mining systems are able to analyse within a reasonable period of time, when solving classifi cation and clustering problems. Three open source data mining systems are investigated: WEKA, KNIME, and ORANGE. The experiments have been carried out with eight datasets, where the number of attributes was fi xed – 100 and the number of instances ranged between 5000 and 600 000. The experimental investigation has shown that when the ORANGE system is used, the data of more than 50 000 instances are of too large volume. In order to analyse larger datasets, the WEKA and KNIME systems need to be used. The data of more than 200 000 instances are of too large volume for WEKA and KNIME, however, when simple classifi cation methods are used, both systems are able to handle 400 000 instances, and KNIME – 600 000 instances. The results have showed that KNIME can handle larger datasets than WEKA, when applying some classifi cation methods. The accuracy of classifi cation is high enough, when the classifi cation methods, implemented in the systems, are used.

%; font-family: Calibri, sans-serif;">

85-95.pdf

Nuorodos

Atsisiuntimai

Nėra atsisiuntimų.

Dažniausiai skaitomi to paties autoriaus (-ių) straipsniai

Tomas Petkus, Olga Kurasova, Ilona Ciunel, Mokytojų poreikio prognozė , Information & Media: T. 72 (2015): Informacijos mokslai
Ričardas Toliušis, Olga Kurasova, Jolita Bernatavičienė, Akies dugno nuotraukų semantinis segmentavimas naudojant konvoliucinius neuroninius tinklus , Information & Media: T. 85 (2019): Informacijos mokslai
Olga Kurasova, Virginijus Marcinkevičius, Viktor Medvedev, Aurimas Rapečka, Duomenų tyrybos sistemos, pagrįstos saityno paslaugomis , Information & Media: T. 65 (2013): Informacijos mokslai
Pavel Stefanovič, Olga Kurasova, Tekstinių dokumentų panašumų paieška naudojant saviorganizuojančius neuroninius tinklus ir k vidurkių metodą , Information & Media: T. 65 (2013): Informacijos mokslai
Pavel Stefanovič, Olga Kurasova, Saviorganizuojančių neuroninių tinklų sistemų lyginamoji analizė , Information & Media: T. 50 (2009): Informacijos mokslai
Alma Molytė, Olga Kurasova, Vektorių kvantavimo metodų ir daugiamačių skalių junginys daugiamačiams duomenims vizualizuoti , Information & Media: T. 50 (2009): Informacijos mokslai