University of Tampere

TamPub Julkaisuarkisto - TamPub Institutional Repository
Not a member yet
    47495 research outputs found

    Aikuispituus sydäninfarktin riskitekijänä

    No full text

    Cure, Community, and the Miraculous in Early Modern Florence

    No full text

    Tilaamisen todennäköisyyden ennustaminen verkkokäyttäytymisestä koneoppimismenetelmin

    No full text
    Palvelun tilaajakannan kasvattamiseen kuuluu kaksi peruselementtiä: uusien tilaajien hankinta ja vanhojen tilaajien pito. Tässä tutkielmassa keskitytään uusien asiakkaiden hankintaan. Tutkimusongelmana on palvelun tilaamisen todennäköisyyden ennustaminen verkkokäyttäytymisen perusteella. Käytetyt algoritmit ovat todennäköisyyksien ennustamiseen soveltuvat päätöspuut C4.5 ja CART sekä satunnaismetsä. Tässä kontekstissa tilaaminen on melko harvinainen tapaus, ja käsiteltävä datan luokkajakauma on epätasapainossa. Tutkielmassa keskitytään epätasapainoisen datan käsittelytapoihin. Otantamenetelmistä testattavaksi on valittu satunnainen aliotanta ja SMOTE, ja lisäksi otantamenetelmiä kokeillaan viidellä luokkasuhteella. Satunnaisessa aliotannassa datasta poistetaan satunnaisesti enemmistöluokan havaintoja ja SMOTEssa yhdistettynä aliotantaan sekä poistetaan enemmistöluokan havaintoja että luodaan vähemmistöluokan havaintojen pohjalta uusia synteettisiä havaintoja. Koska otanta vaikuttaa ennustettaviin todennäköisyyksiin, ennustettujen todennäköisyyksien kalibroinnissa hyödynnetään Plattin skaalausta tai isotonista regressiota. Luokittelualgoritmeja, otantamenetelmiä, otantasuhteita sekä kalibrointimenetelmiä yhdistelemällä luotiin yhteensä 90 erilaista ennustemallia. Malleja verrattiin logaritmisen tappion sekä Brierin pisteiden avulla, jotka ovat todennäköisyyksien ennustamisessa yleisesti käytettyjä evaluointimetriikoita. Parhaaksi ennustajaksi osoittautui malli, jossa yhdistettiin satunnaismetsä, SMOTE luokkasuhteella 4:1 ja isotoninen regressio. SMOTE toimi satunnaista aliotantaa paremmin ja isotoninen regressio toimi SMOTEn kanssa Plattin skaalausta paremmin. Testauksessa parhaan mallin logaritminen tappio on 0,1 ja Brierin pisteet 0,02. Kun ennustetut todennäköisyydet binärisoidaan luokiksi raja-arvolla t = 0,02, saadaan mallin tarkkuudeksi, sensitiivisyydeksi ja spesifisyydeksi 0,6. Rajaa pienentämällä saadaan sensitiivisyyttä kasvatettua väärien positiivisten kustannuksella. Tarvittaessa siis tunnistetaan hyvin tilanneita, mutta silloin malli ennustaa myös paljon ei-tilanneita tilanneiksi. Luokittelukyky jää kokonaisuudessaan melko heikoksi, mutta toisaalta tutkimusongelman kannalta tärkeintä on havaita potentiaaliset tilaajat, joten väärät positiiviset eivät ole välttämättä kovin haitallisia

    0

    full texts

    47,495

    metadata records
    Updated in last 30 days.
    TamPub Julkaisuarkisto - TamPub Institutional Repository
    Access Repository Dashboard
    Do you manage Open Research Online? Become a CORE Member to access insider analytics, issue reports and manage access to outputs from your repository in the CORE Repository Dashboard! 👇