Hjem Personlig finansiering Hvordan man renser data til prædiktiv analyse - dummier

Hvordan man renser data til prædiktiv analyse - dummier

Video: Hvordan kan man sende data over elledninger? 2025

Video: Hvordan kan man sende data over elledninger? 2025
Anonim

Før du kører en forudsigende analyse, skal du sørge for, at dataene er rene af fremmede ting, før du kan bruge det i din model. Dette omfatter at finde og rette eventuelle poster, der indeholder fejlagtige værdier, og forsøger at udfylde eventuelle manglende værdier. Du skal også beslutte, om du skal medtage dublette poster (to kundekonti, for eksempel).

Det overordnede mål er at sikre integriteten af ​​de oplysninger, du bruger til at opbygge din prædiktive model. Vær særlig opmærksom på datas fuldstændighed, rigtighed og aktualitet.

Det er nyttigt at oprette beskrivende statistikker (kvantitative egenskaber) for forskellige felter, såsom beregning af min og max, kontrol frekvensfordeling (hvor ofte sker noget) og verificere de forventede intervaller. Hvis du kører en regelmæssig check, kan du flagge alle data, der ligger uden for det forventede område for yderligere undersøgelse. Eventuelle poster, der viser pensionister med fødselsdatoer i 1990'erne, kan markeres med denne metode.

Det er også vigtigt at krydstjekke oplysningerne, så du sikrer, at dataene er korrekte. For en dybere analyse af dataegenskaberne og identifikation af forholdet mellem dataposter kan du benytte data profiling (analyse af data tilgængelighed og indsamling af statistikker om datakvaliteten) og visualiseringsværktøjer.

Manglende data kan skyldes, at bestemte oplysninger ikke blev registreret. I et sådant tilfælde kan du forsøge at udfylde så meget som muligt; Egnede standardindstillinger kan let tilføjes for at udfylde emnerne i bestemte felter.

For eksempel på patienter i en sygeplejerskefødselsafdeling, hvor kønsfeltet mangler en værdi, kan ansøgningen simpelthen udfylde den som kvindelig. For så vidt angår enhver mand, der blev optaget på et hospital med en manglende post for graviditetsstatus, kan denne post ligeledes udfyldes som ikke relevant.

En manglende postnummer for en adresse kan udledes af gadenavnet og den by, der er angivet i denne adresse.

I de tilfælde, hvor oplysningerne er ukendte eller ikke kan udledes, skal du bruge værdier andre end et tomt rum for at angive, at dataene mangler uden at påvirke analysens rigtighed. Et tomt i dataene kan betyde flere ting, de fleste af dem er ikke gode eller nyttige. Når du kan, skal du angive naturen af ​​det blanke ved et meningsfuldt stedfyldemiddel.

Ligesom det er muligt at definere en rose i en kornmark som en ukrudt, kan outliers betyde forskellige ting til forskellige analyser.Det er almindeligt, at nogle modeller skal bygges udelukkende for at spore disse outliers og flagge dem.

Frauddetekteringsmodeller og overvågning af kriminelle aktiviteter er interesserede i de afvigende, som i sådanne tilfælde viser noget uønsket sted. Derfor anbefales det at holde outliers i datasættet i tilfælde som disse. Men når uregelmæssigheder betragtes som uregelmæssigheder inden for dataene - og kun vil forskere analyserne og føre til fejlagtige resultater - fjern dem fra dine data.

Duplikering i dataene kan også være nyttigt eller en gener; noget af det kan være nødvendigt, kan indikere værdi og kan afspejle en nøjagtig tilstand af dataene. For eksempel kan en rekord af en kunde med flere konti repræsenteres med flere poster, der (teknisk set alligevel) er duplikat og gentagne af de samme poster.

Når de dobbelte optegnelser ikke bidrager med værdien til analysen og ikke er nødvendige, kan fjernelse af dem være af stor værdi. Dette gælder især for store datasæt, hvor fjernelse af dublette poster kan forenkle dataens kompleksitet og reducere den tid, der er nødvendig til analyse.

Du kan forebyggende forhindre ukorrekte data i at komme ind i dine systemer ved at vedtage nogle specifikke procedurer:

  • Institutkvalitetskontrol og data validering for alle data, der indsamles.

  • Tillad dine kunder at validere og selvkorrekte deres personlige data.

  • Giv dine kunder mulige og forventede værdier at vælge imellem.

  • Rutinemæssigt kører kontrol af dataets integritet, konsistens og nøjagtighed.

Hvordan man renser data til prædiktiv analyse - dummier

Valg af editor

Fotografering af fugle Brug af dine digitale spejlreflekskameraer

Fotografering af fugle Brug af dine digitale spejlreflekskameraer

Du kan optage interessante billeder af fugle store og små med din digitale spejlreflekskamera . Du behøver bare lidt tålmodighed og lidt viden om den fugl, du vil fotografere. En fuglefoder er et ideelt sted at fotografere små fugle. Du kan rejse til et område med en sø eller flod eller til ...

Fotografering af byer med dine digitale spejlreflekskameraer

Fotografering af byer med dine digitale spejlreflekskameraer

Om du bor i en søvnig lille by eller en storby, der overfylder menneskeheden kan din digitale spejlreflekskamera fange hjertet og sjælen i din hjemby. Du kan eksperimentere med at tage billeder om natten, når byen er dramatisk eller øde eller om dagen, når beboerne og deres aktiviteter gør byen ...

Fotografering af objekter i bevægelse - dummier

Fotografering af objekter i bevægelse - dummier

Der er et par tankeskoler om fotografering af objekter i bevægelse. Opskriften på en perfekt eksponering kan opnås på mange måder. Du kan vælge en lille blænde (stort f-stopnummer) for at få en stor dybdeskarphed, eller du kan vælge en hurtig lukkerhastighed, hvilket betyder en stor blænde (lille ...

Valg af editor

Hvordan man fortjener mor fra blogging uden at sælge - dummier

Hvordan man fortjener mor fra blogging uden at sælge - dummier

Sælger er et udtryk, der anvendes til kompromittere din integritet, principper eller moral for at vinde penge eller succes. Problemet er, at hvis alle havde de samme principper og definition af integritet, ville der ikke være meget behov for forskellige politiske partier eller religioner. Folk kan anklaget for at sælge ud, hvis de simpelthen gør ting som ...

Hvordan man korrekt bruger nøgleord til din online community - dummies

Hvordan man korrekt bruger nøgleord til din online community - dummies

Når du har en god ide om hvilke typer søgeord der skal bruges i dit online-fællesskab, er det tid til at skrive indholdet, så det ser naturligt ud. For mange mennesker peber søgeord liberalt omkring deres blogindlæg, web artikler, Om sider og andet indhold, som ser dumt og forkert ud. Selvom du bruger nøgleord, er det godt ...

Sådan sættes annoncer på din blog - dummies

Sådan sættes annoncer på din blog - dummies

For at få annoncer på din blogwebsite, de programmer du tilmelde dig normalt give dig en smule kode, som du indsætter i din hjemmeside skabeloner. Nogle programmer har trinvise instruktioner til populære blogsoftwarepakker, men vær opmærksom på at du måske også har brug for at konsultere dokumentation til blogsoftware til hjælp med ...

Valg af editor

Ompirrende Signaler og hvad de betyder i Cricket - Dummies

Ompirrende Signaler og hvad de betyder i Cricket - Dummies

Embedsmændene med ansvar for et cricketpil er kaldet umpires, og de har en lang række signaler til at angive de beslutninger, de træffer i løbet af et spil. Disse er de vigtigste. Højre arm udstrakte. No-bold. Dette signal indikerer, at bowlerens fod har landet over frontlinjen af ​​...

Vælg en Tennis Racquet - Dummies

Vælg en Tennis Racquet - Dummies

Ja, du kan støv af den racquet, du spillede for fem år siden og give det en strålende tilbagevenden til retten - hvis det føles godt i din hånd og det får dine skud hvor (og hvordan) vil du have dem til at gå. Hvis du er på markedet for et nyt våben, vil du dog ...

Skæring og dicing, tennis stil - dummies

Skæring og dicing, tennis stil - dummies

Skive eller backspin, får tennisbolden til at vende tilbage mod effektkilde (dig). Når et stykke skud springer, forbliver bolden lavt, hvilket tvinger din modstander til virkelig at strække for at komme til bolden. Hvis spillere gerne angriber nettet og volley, skar de meget. Skiven kan være en nyttig ...