Hyppää pääsisältöön

Tarkenna hakuasi

Aurinko.

FM Saifullah Khan, väitös 9.10.2026: Suhteellisen yksinkertaiset tilastolliset menetelmät voivat parantaa koneoppimisen suorituskykyä merkittävästi

Tietojenkäsittelytieteen alaan kuuluva väitöskirja tarkastetaan luonnontieteiden, metsätieteiden ja tekniikan tiedekunnassa. Tilaisuutta voi seurata Kuopion kampuksella.

FM Saifullah Khanin väitöstutkimuksessa tarkastellaan, kuinka laskennallisesti kevyillä ja tulkittavilla tilastollisilla menetelmillä voidaan parantaa koneoppimista kehittämällä dataa ennen mallin koulutusta ja sen aikana. Työ keskittyy korrelaatioanalyysiin, datan augmentointiin, puuttuvien tietojen imputointiin, piirteiden vähentämiseen, poikkeavien havaintojen ja kohinan hallintaan sekä rajoitettuihin aktivointifunktioihin. 

Aihe on tärkeä, koska edistyneetkin koneoppimismallit voivat toimia heikosti, jos syötedata on puutteellista, kohinaista, heikosti relevanttia tai voimakkaasti vaihtelevaa. Datan laadun parantaminen voi lisätä ennustetarkkuutta ja yleistettävyyttä ilman, että tarvitaan aina suurempia tai monimutkaisempia malleja, ja samalla voidaan vähentää laskennan ja datankeruun kustannuksia. Tämä vastaa suoraan väitöskirjan tavoitetta käyttää tilastollisia menetelmiä kohinan vähentämiseen, merkityksellisten piirteiden vahvistamiseen ja ennustesuorituskyvyn parantamiseen.

Mitkä ovat väitöstutkimuksesi keskeiset tulokset tai havainnot?

Väitöskirja osoittaa, että suhteellisen yksinkertaiset tilastolliset menetelmät voivat parantaa koneoppimisen suorituskykyä merkittävästi. Polynomial Abet (PA) -datan augmentointi saavutti keskimääräisen RRMSE-arvon 0,464 prosenttia, kun polynomial feature transformation -menetelmällä vastaava arvo oli 1,088 prosenttia. Tämä tarkoitti 57,40 prosenttia parannusta samalla, kun laskenta-aika väheni 14,02 prosenttia. Seasonal Mean Imputation (SMI) paransi tuulivoimaennustamista hyödyntämällä kausittaista tietoa puuttuvien arvojen korvaamisessa. Raportoidussa LSTM-kokeessa SMAPE-tulos parani 102,74 prosenttia verrattuna keskiarvoimputointiin, kun arviointimittarina käytettiin ennustusvirheen prosentuaalisen paranemisen suhdetta puuttuvan datan prosenttiosuuteen. Skewness Driven Distribution Imputation (SDDI) tarjosi laskennallisesti yksinkertaisen ja jakauman huomioivan vaihtoehdon puuttuvan datan käsittelyyn. Korrelaatioon perustuva piirteiden valinta puolestaan osoitti, että huomattavasti pienemmällä datamäärällä voidaan säilyttää lähes sama ennustetarkkuus; esimerkiksi dataa voitiin vähentää 60,5 prosenttia, kun tarkkuus muuttui vain 3 prosenttia. Väitöskirjassa esitellään myös Tanned-ReLU, rajoitettu ja sileä aktivointifunktio, joka paransi ennustesuorituskykyä erilaisilla monimuuttujaisilla aineistoilla. 

Keskeinen uutuusarvo on tilastollisten menetelmien järjestelmällinen käyttö datan kuvaamisen lisäksi aktiivisesti siihen vaikuttamiseen, mitä koneoppimismallit oppivat: ulkoisesti esikäsittelyn kautta ja sisäisesti aktivoinnin hallinnan avulla. Esimerkiksi Tanned-ReLU vähensi RRMSE-arvoa testatuissa aineistoissa parhaimmillaan 82,44 prosenttia verrattuna P-ReLUun ja paransi tuloksia myös L-ReLUun ja ReLUun verrattuna.

Miten väitöstutkimuksesi tuloksia voidaan hyödyntää käytännössä? 

Tuloksia voidaan hyödyntää tilanteissa, joissa koneoppimisjärjestelmien on toimittava puutteellisen, kohinaisen tai voimakkaasti vaihtelevan datan kanssa. Ehdotetut menetelmät voivat tukea luotettavampaa ennustamista esimerkiksi energiantuotannossa, langattomissa verkoissa, ympäristön seurannassa ja muissa anturipohjaisissa sovelluksissa. Korrelaatioon perustuva piirteiden vähentäminen voi auttaa organisaatioita keräämään ja käsittelemään vain kaikkein hyödyllisimpiä muuttujia, mikä voi pienentää antureihin, tallennukseen, integraatioon ja laskentaan liittyviä kustannuksia. SMI- ja SDDI-imputointimenetelmillä voidaan täydentää puuttuvia mittauksia, kun taas PA voi parantaa oppimista rajallisista aineistoista. Tanned-ReLUa voidaan käyttää vaihtoehtoisena aktivointifunktiona neuroverkoissa, jotka käsittelevät voimakkaasti vaihtelevaa monimuuttujaista dataa. Menetelmät tarjoavat käytännöllisiä keinoja koneoppimisen suorituskyvyn parantamiseen ilman, että mallien monimutkaisuutta tarvitsee automaattisesti lisätä.

Kuvaile väitöstutkimuksesi tutkimusprosessia. Mitkä ovat esimerkiksi tutkimuksesi keskeiset tutkimusmenetelmät ja aineistot? 

Väitöskirja perustuu neljään vertaisarvioituun tutkimukseen, joissa tehtiin empiirisiä koneoppimiskokeita todellisilla aineistoilla. Kehitimme ja arvioimme tilastollisia menetelmiä datan augmentointiin, puuttuvan datan imputointiin sekä neuroverkkojen aktivointifunktioihin.

Aineistoihin kuului ydinvoiman aikasarjadataa 31 Yhdysvaltain osavaltiosta, operatiivista tuulivoimadataa pakistanilaisesta tuulivoimalasta, Saksasta kerättyä 5G Vehicle-to-Everything -palvelunlaatudataa sekä muita monimuuttujaisia aineistoja, kuten Suomen sähköverkon tuulivoimadataa ja pienempiä avoimen lähdekoodin aineistoja, mukaan lukien IoT-pohjainen vedenlaadun seuranta. 

Ehdotettuja menetelmiä verrattiin tutkimusten tekoajankohtana vakiintuneisiin vaihtoehtoihin käyttäen muun muassa LSTM-, GRU- ja XGBoost-malleja. Suorituskykyä arvioitiin muun muassa RMSE-, RRMSE- ja SMAPE-mittareilla sekä ennustetarkkuuden, korrelaation ja laskenta-ajan perusteella. Toistettuja kokeita ja ristiinvalidointia käytettiin soveltuvissa tilanteissa.

Onko väitöskirjastasi jotain muuta, jonka haluaisit tuoda esiin? 

Väitöskirjan keskeinen viesti on, että koneoppimisen esikäsittelyvaiheeseen tulisi kiinnittää enemmän huomiota. Vaikka yhä monimutkaisempien mallien kehittäminen on tärkeä tutkimusalue, mallille annettavan datan laatu ja rakenne vaikuttavat voimakkaasti sen suorituskykyyn, mutta datan esikäsittely saa usein suhteellisesti vähemmän huomiota. 

Tämä väitöskirja osoittaa, että datan huolellinen tarkastelu ja parantaminen tilastollisilla menetelmillä, kuten korrelaatioanalyysillä, imputoinnilla, augmentoinnilla ja kohinan vähentämisellä, voi parantaa merkittävästi ennustamista, tehokkuutta ja tulkittavuutta. Työ korostaa siten, että sen ymmärtäminen, miten data valmistellaan ennen oppimisen alkamista, on aivan yhtä tärkeää kuin itse koneoppimismallin kehittäminen.

FM Saifullah Khanin tietojenkäsittelytieteen alaan kuuluva väitöskirja Computational intelligence for improving performance of machine learning models via statistics - Correlations, Imputation, Outlier detection, and Augmentation (Laskennallinen älykkyys koneoppimismallien suorituskyvyn parantamiseksi tilastollisin menetelmin. Korrelaatiot, imputointi, poikkeavien havaintojen tunnistaminen ja aineiston augmentointi) tarkastetaan luonnontieteiden, metsätieteiden ja tekniikan tiedekunnassa, Kuopion kampuksella. Vastaväittäjänä toimii apulaisprofessori Juho Kannala, Aalto-yliopisto, ja kustoksena professori Pekka Toivanen, Itä-Suomen yliopisto. Tilaisuuden kieli on englanti.

Lisätietoja: 

Saifullah Khan, [email protected], p. +358 50 327 0452