Data mining-oversigt
I denne digitale tidsalder akkumulerer organisationer naturligt stadig større maengder data, og mange ledere ser det i dag som en skattekiste af handlekraftig indsigt. Så hvad er data mining, og hvordan letter det udvinding af værdifulde oplysninger fra datasæt? Data mining er processen med at opdage nyttige oplysninger fra en akkumulering af data, ofte fra et datawarehouse eller en samling af sammenkædede datasæt. Data mining kan involvere maskinindlæring, statistisk analyse og andre effektive analytiske værktøjer, der bruges til at gennemgå store datasæt for at identificere tendenser, skjulte mønstre, uregelmæssigheder og relationer til at understøtte informeret beslutningstagning og planlægning.
En af de mindre åbenlyse fordele ved data mining – og en vaesentlig årsag til, at data mining er vigtig i dag – er, at det forvandler akkumuleringen af data, som ofte akkompagnerer digitalisering, til en fordel. Efterhånden som organisationer i stigende grad moderniserer og digitaliserer deres drift, har de tendens til at generere og akkumulere flere og flere data. Så for en stor virksomhed, der har massive datasæt, giver data mining en effektiv måde at gøre brug af et væld af oplysninger, de allerede er i besiddelse af.
Hvorfor er data mining vigtigt?
Data mining er vigtigt, fordi det forvandler organisationens data til en nøglekomponent i business intelligence. Data mining-værktøjer er indbygget i executive dashboards, høster indsigt fra big data, herunder data fra sociale medier, Internet of Things (IoT) sensorfeeds, placeringsbevidste enheder, ustruktureret tekst, video og meget mere. Moderne data mining er baseret på cloud og virtuel computing, samt in-memory databaser, til at administrere data fra mange kilder omkostningseffektivt og skalere efter behov.
Så hvilken form for forretningsværdi kan data mining levere? Den primære fordel ved data mining er dens evne til at identificere mønstre og relationer i store mængder af data fra flere kilder, herunder sociale medier, fjernsensorer og andet overvågningsudstyr, stadig mere detaljerede rapporter om produktbevægelser og markedsaktivitet, og, afgørende, applikationer og anden software, der anvendes af organisationen.
Det betyder to ting. Data mining kan hjælpe mennesker i forskellige roller, på tværs af brancher, til at tænke uden for boksen ved at trække på en bred vifte af kilder og afsløre uoplagte relationer og mønstre i tilsyneladende urelaterede bidder af information. Dette gør data mining vigtig for store organisationer, især virksomheder, hvor information har tendens til at blive opdelt – siloed.
Desuden omfatter fordelene ved data mining ikke kun salg, men også andre forretningsområder: Takket være denne evne til at nedbryde siloer kan det styrke en bred vifte af roller. Ingeniører og designere kan analysere effektiviteten af produktændringer og se efter mulige årsager til produktsucces eller -fejl. Service- og reparationsoperationer kan bedre planlægge reservedelslager og bemanding. Professionelle serviceorganisationer kan bruge data mining til at identificere nye muligheder, der er skabt af ændrede økonomiske tendenser og demografiske ændringer. Dataminering kan endda hjælpe med at afsløre svindel, især i industrier som finansiering, detailhandel og sundhedspleje.
Med andre ord dækker de potentielle fordele ved data mining hele spektret af forretningsfunktioner: fra at bidrage til at øge indtjeningen og reducere omkostningerne til at forbedre kunderelationer, forebygge svindel og finjustere salgsprognoser.
Data mining er vigtigt, fordi det kan give betydelig forretningsværdi for en række mål – for eksempel:
- Udarbejd handlingsrettet indsigt, der hjælper med at træffe informerede, datadrevne beslutninger
- Tilbyd yderligere kontekst for at gøre planlægning og salgsprognoser mere nøjagtige
- Afslør muligheder for at reducere omkostningerne, reducere unødvendige udgifter og fjerne flaskehalse og ineffektivitet i processer
- Identificer mønstre, der tyder på svindel, og få øje på sårbarheder, før de udnyttes
- Tilpas marketing og forbedr kundeoplevelsen takket være øget forståelse af kundeadfærd
Hvordan virker data mining?
Kort sagt fungerer data mining ved hjælp af maskinindlæring, statistisk analyse og andre analytiske værktøjer til at analysere store sæt af rådata og opdage skjulte mønstre, der kan bruges til at få handlingsrettet indsigt. De faktiske dataudvindingsteknikker og trin afhænger af den type spørgsmål, der stilles, og indholdet og organiseringen af databasen eller datasæt, der leverer råstoffet til søgning og analyse. Når det er sagt, er der nogle trin, som en data mining-proces typisk involverer.
5-trinsprocessen for data mining
1. Dataindsamling:
- Definer, hvilket problem eller område af forespørgsel du undersøger.
- Overvej hvilke former for eksterne og interne faktorer, der kan være relevante for emnet for din udforskning.
- Indsaml rådata fra forskellige kilder, herunder din organisations database og eksterne data, der er en del af dine operationer, f.eks. salgs- og servicedata, IoT eller data på sociale medier.
2. Forbehandling af data:
- Gennemgå de datakilder, du har indsamlet, og sørg for, at du har rettigheder til at få adgang til og bruge de eksterne data, herunder demografi, økonomiske data og markedsoplysninger, såsom branchetendenser og finansielle benchmarks fra brancheorganisationer og regeringer; lovgivningen om databeskyttelse kan variere betydeligt afhængigt af regionen og kan ændres, så dette er et afgørende skridt.
- Engager emneeksperter til at hjælpe med at definere, kategorisere og organisere dataene – denne del af processen kaldes nogle gange data tovtrækning eller data munging.
- Ryd op i de indsamlede data, og fjern duplikering, inkonsistenser, ufuldstændige poster eller forældede formater.
3. Modelopbygning:
- Vælg relevante algoritmer og teknikker (såsom beslutningstræer, regression eller klyngedannelse – mere om data mining-teknikker nedenfor).
- Træn flere modeller på dine forbehandlede data, eller finindstil deres parametre for at optimere ydeevnen.
- Test modellens nøjagtighed ved hjælp af valideringsteknikker for at sikre pålidelig ydeevne på nye data.
- Sammenlign forskellige modelleringsmetoder, og identificer den bedste mulighed for dine specifikke mål.
4. Evaluering:
- Vurder modellens pålidelighed på tværs af nøglemetrikker som f.eks. nøjagtighed, præcision og fejlprocenter.
- Identificer potentielle problemer såsom skævheder, overtilpasning eller datakvalitetsproblemer.
5. Fortolkning:
- Identificer, hvilke datafaktorer der har størst effekt på forudsigelser og resultater – dette vil hjælpe dig med at forklare de vigtigste resultater for interessenterne.
- Afhængigt af teamstrukturen kan det være nødvendigt at oversætte modelresultater til indsigt og levere rapporter eller visualiseringer, der gør resultaterne tydelige for ikke-tekniske beslutningstagere og andre interessenter i hele organisationen.
- Formuler specifikke handlingsrettede anbefalinger til forretningsstrategi, drift og processer baseret på de opdagede mønstre.
- Vælg relevante metrikker, og opret en plan for at måle effekten af implementering af anbefalinger, der er afledt af data mining.
Nøgledata mining-teknikker
Klassificering
En almindelig datamineringsteknik omfatter sortering af nye data i foruddefinerede kategorier baseret på mønstre, der er lært af historiske data, f.eks. gruppering af kunder baseret på, om de sandsynligvis vil vende tilbage ved at analysere deres indkøbsmønstre, betalingshistorik og engagementsniveauer. Dette vil ikke kun hjælpe med at skelne mellem vigtige kundesegmenter, men også uddybe din forståelse af dine kunderelationer.
Afvigelsesdetektering
Afvigelsesdetektion er særlig vigtig for mål som forebyggelse af svig, netværkssikkerhed og identitetskontrol. For eksempel kan denne datamineringsteknik hjælpe med at spotte usædvanlig kreditkortaktivitet, der afviger fra en kundes typiske brug, baseret på faktorer som uventede steder, usædvanlige onlinekøb eller ukarakteristisk store beløb. Men data mining-metoder kan også hjælpe med at opdage nye forudsigelser, der ikke er så indlysende, hvilket bringer os til den næste data mining-teknik.
Klyngedannelse
Klyngedannelse er en data mining teknik, der har til formål at opdage naturlige grupperinger baseret på ligheder i data snarere end foruddefinerede antagelser (i modsætning til klassificering), i sidste ende afsløre skjulte mønstre og relationer. I kreditkorteksemplet kunne klyngedannelse afdække yderligere flag for mistænkelig aktivitet. For eksempel kan historiske data fra konti, der har lidt af svindlere, afsløre, at en statistisk signifikant del af dem deler en anden lighed: måske har de alle vist et mønster af små testkøb fra en bestemt forhandler, efterfulgt af store transaktioner. Derefter kunne dette mønster i fremtiden bruges til at opdage svigagtig aktivitet i realtid.
Associeringsregler
En anden vigtig dataudvindingsteknik er associeringsregel-mining: sammenkædning af to tilsyneladende urelaterede hændelser eller aktiviteter. Forestil dig, at du forsøger at optimere produktplacering i et supermarked for at maksimere salget. Det tager ikke data mining at spekulere i, at f.eks. kunder, der køber bleer, sandsynligvis også køber andre babyprodukter, såsom babyservietter. Men denne datamining teknik kan opdage andre, mindre indlysende, krydssalg muligheder: måske, vil du bemærke, at kunder, der lagerfører op på engangsbestik om sommeren er også mere tilbøjelige til at købe insektafvisende og skumfiduser. Disse produkter ville normalt befinde sig i forskellige produkt-øer, men data mining kan pege på en sæsonbestemt shopping mission: at få forsyninger til at tilbringe tid udendørs. I dette scenario vil dataudvindingsteknikken for associeringsreglen hjælpe detailhandleren med at udnytte denne sæsonbestemte salgsmulighed.
Regression
En af de matematiske data mining-teknikker, regressionsanalyse forudsiger et tal baseret på historiske mønstre. Det er et klassisk værktøj, der anvendes i mange felter og kontekster, herunder salgsprognoser, aktiekursprognoser og økonomisk analyse.
Bemærk, at disse er blot nogle få af de mest almindelige typer af data mining-teknikker, der ofte findes i data mining-værktøjssæt.
Anvendelser og eksempler på data mining
Anvendelseseksempler på data mining omfatter følelsesanalyse, prisoptimering, databasemarketing, kreditrisikostyring, uddannelse og support, afsløring af svindel, sundhedsmæssige og medicinske diagnoser, risikovurdering, krydssalg og opsalgsanbefalingssystemer og meget mere. Og det kan være et effektivt værktøj i næsten enhver industri, fra detail- og engrossalg til produktion, sundhedspleje og finansiering.
Nøgleanvendelseseksempler for data mining
Produktudvikling
Virksomheder, der designer, fremstiller eller distribuerer fysiske produkter, kan bruge data mining til at identificere muligheder for bedre at målrette deres produkter ved at analysere indkøbsmønstre kombineret med økonomiske og demografiske data. Designere og ingeniører kan også krydsreferere kunde- og brugerfeedback, reparationsposter og andre data for at identificere muligheder for produktforbedringer. Og erhvervslivets beslutningstagere kan endda vaelge, hvilke nye typer produkter, der skal introduceres ud fra, hvad kunderne typisk ser ud til at købe sammen med de nuvaerende produkter.
Eksempler på data mining, der bruges til at styre produktudviklingen:
- Analyse af kundekøbsdata afslører en forening: Når man køber fitness-trackere, vil kunderne sandsynligvis også købe andet tilbehør, såsom vandflasker eller træningstøj. Dette giver en mulighed for fitness tracker producenten til at begynde at tilbyde branded vandflasker eller til at samarbejde med et fitness tøj mærke for en eksklusiv mærkevarer linje, også.
- En smart home enheds brugsdata viser, at meget få kunder bruger dette produkts premium funktion, mens kundeundersøgelser viser, at mange har svært ved at identificere, hvilken knap der slår funktionen til. Ændring af enhedens design for at gøre knappen mere mærkbar kan tilskynde flere kunder til at bruge premium-funktionen og som følge heraf forbedre deres opfattelse af produktets værdi for pengene.
Produktion
Producenter kan spore kvalitetstendenser, reparationsdata, produktionshastigheder og data om produkters ydeevne fra feltet for at identificere produktionsproblemer. De kan også genkende mulige procesopgraderinger, der ville forbedre kvaliteten, spare tid og ressourcer, forbedre produktets ydeevne og pege på behovet for nyt eller bedre fabriksudstyr.
Eksempler på data mining, der bruges til at optimere produktionsprocesser:
- Analyser af serviceanmodningshistorik afslører, at hændelser med udstyrsfejl i de kolde måneder, hvilket tyder på, at noget udstyr kan være følsomt over for temperatursvingninger. Investering i bedre temperaturstyring på produktionsområdet kan reducere nedetiden og spare tid for teknikere i marken.
- Nøjagtig analyse af den historiske efterspørgsel efter reservedele og andre data relateret til udbuddet kan forudsige perioder med sandsynlig mangel på kritiske dele, hvilket giver producenterne mulighed for at lagre op på forhånd.
Servicebrancher
I servicebrancher kan virksomheder finde lignende muligheder for serviceforbedringer ved at krydsreferere kundefeedback (direkte eller fra sociale medier eller andre kilder) med specifikke tjenester, kanaler, kundesupportsager, data om peer-performance, region, prisfastsættelse, demografi, økonomiske data og andre faktorer.
Eksempler på data mining, der bruges til at sikre kundepersonalisering i servicebrancherne:
- Ved at krydshenvise kundedata, besøgsregistreringer og indstillinger for kunderelationer opdager en sundhedsudbyder, at rater for manglende fremmøde varierer efter kundens aldersgruppe, afhængigt af hvilke kanaler der bruges til aftalepåmindelser. Tilpasning af kommunikationen om kommende besøg i hver aldersgruppe ville så hjælpe flere kunder med at gøre det til deres aftaler.
- Analyse af kundesupportforespørgsler viser, at patienter, der forventer en genopfyldning af visse typer medicin, er mere tilbøjelige til at kontakte support for en statusopdatering på genopfyldningen. Hvis sundhedspersonalet proaktivt retter sig mod disse patienter med automatiske genopfyldningsmeddelelser, kan denne personlige kommunikation både forbedre kundetilfredsheden og reducere belastningen af kundesupport.
- En analyse af kundeengagementet med en digital abonnementstjeneste viser, at et vist fald i forbruget forudsiger, at abonnementet opsiges inden for tredive dage. Gen-engagerende brugeren med brugerdefinerede anbefalinger, brugsoptimering tips, eller endda personlige rabatter kan hjælpe med at forbedre brug og værdi opfattelse og i sidste ende fastholde kunden.
Salgsprognose
Uanset branche er data mining uvurderlig for salgsprognoser og planlægning. Datadrevet indsigt kan hjælpe med at forudse udsving i efterspørgslen, forbedre markedsanalysen, forudsige prisændringer og meget mere.
Eksempler på data mining, der bruges til at finjustere salgsprognoser:
- Et forsikringsselskab analyserer en bred vifte af datasæt, både interne og eksterne, og opdager, at kørselsforholdene forventes at forværres i en bestemt periode, hvor der forventes dårligt vejr – og samtidig er der en midlertidig mangel på vinterdæk. Disse oplysninger hjælper dem med at lave en mere præcis prognose for deres salg af bilforsikringer baseret på forventet stigning i efterspørgslen.
- En producent af et mellemstort forbrugsprodukt analyserer markedet og finder ud af, at flere konkurrenter introducerer luksusproduktlinjer, der saelges til en premium. Nogle af deres kunder er skuffede over forandringen og beslutter at tage deres forretning et andet sted hen, hvor de ser på midtier-tilbud. Denne producent kan justere deres salgsstrategi for at forsøge at gribe denne mulighed for at vinde over disse kunder.
Registrering af svindel
Data mining anvendes i vid udstrækning til afsløring af svindel – kreditkorteksemplet ovenfor er blot et af mange tilfælde af bedrageriforebyggelse i forbindelse med datamining. Teknikken til registrering af uregelmæssigheder hjælper med at markere mistænkelige afvigelser, men andre data mining-metoder er også nyttige, hvilket hjælper med at afdække nye mønstre og løbende forbedre foranstaltningerne til forebyggelse af svig.
Eksempler på data mining, der bruges til at forbedre afsløring af svig:
- En digital varesælger spotter et mønster af usædvanlige køb på de konti, der tilgås fra en ny lokation. For at reducere uautoriseret adgang til konti kan virksomheden kontakte kontoindehavere, når et sådant mønster opstår, markere disse transaktioner og tilbyde en nem måde at annullere køb eller opdatere kontosikkerhed.
- En organisation kan træne en model til at bortfiltrere phishing-e-mails ved hjælp af klassificeringsdata mining-teknikken for at knytte visse sproglige markører (hastesprog, stavefejl osv.) til "phishing"-etiketten og forhindre dem i at nå frem til brugernes indbakke.
Fordele og udfordringer ved data mining
De fleste af ulemperne ved data mining opvejes af dens fordele, men der er visse udfordringer ved data mining, som organisationer skal være opmærksomme på.
Big data
Fordel: Der genereres flere og flere data, hvilket giver stadig flere muligheder for datamining og dermed bedre beslutningstagning.
Udfordring: På grund af den høje volumen, høj hastighed og bred vifte af datastrukturer, samt den stigende forekomst af ustrukturerede data, eksisterende systemer kæmper for at håndtere, gemme og gøre brug af denne strøm af input. Så for at udtrække betydning fra Big Data, virksomheder har brug for passende, kraftfuld software.
Brugerkompetence
Fordel: Dataminering og analyseværktøjer kan hjælpe brugere og andre interessenter med at træffe bedre informerede, datadrevne beslutninger.
Udfordring: Selv om værktøjer, der bruges til data mining, er blevet meget mere brugervenlige, tager det noget træning at bruge dem til deres fulde potentiale. Brugerne skal forstå, hvilke data der er tilgængelige, som minimum have en generel idé om, hvordan data mining fungerer, og være dygtige i forretningskonteksten samt lovmæssige og compliance-problemer i forbindelse med brugen af data – som alle tager en vis brugeruddannelse.
Databeskyttelse og lovpligtigt tilsyn
Fordele: Personalisering via datadrevet indsigt kan forbedre kundeoplevelsen.
Udfordring: Data, og især brugerdata, der tilhører privatpersoner, er underlagt myndighedstilsyn. De faktiske databeskyttelsespraksisser og -regler varierer dog fra region til region og er stadig tilbøjelige til at ændre sig, så det kan være udfordrende – men afgørende – for organisationer, der håndterer data, at følge med.
Datakvalitet og -tilgængelighed
Fordel: Stigende store mængder og variationer af tilgængelige data gør datamining vigtigere end nogensinde.
Udfordring: Med mængder af nye data er der også masser af ufuldstændige, ukorrekte, vildledende, svigagtige, beskadigede eller bare almindelige ubrugelige data. Brugerne skal altid være opmærksomme på kilden til dataene, dens troværdighed og pålidelighed samt bekymringer vedrørende privatlivets fred og databeskyttelse; og organisationer skal være ansvarlige for at beskytte deres såvel som deres kunders data mod overtrædelser og anden mishandling.
Data mining vs. relaterede koncepter
Data mining vs. maskinindlæring
Forskellen mellem data mining og maskinlæring er, at maskinindlæring er et sæt værktøjer og algoritmer, der er trænet til at finde mønstre og korrelationer i store datasæt, mens data mining er processen med at udtrække nyttige oplysninger fra en akkumulering af data. Maskinindlæring er et af de værktøjer, der bruges i data mining til at opbygge prognosemodeller, men det er ikke det eneste, og data mining er heller ikke den eneste anvendelse af maskinindlæring.
Data mining vs. analyser
Der er en subtil forskel mellem data mining og dataanalyse. Dataanalyse eller -analyse er generelle termer for den brede vifte af praksisser, der fokuserer på at identificere nyttige oplysninger, evaluere dem og give specifikke svar. Data mining er en type dataanalyse, der fokuserer på at grave i store, kombinerede datasæt for at opdage mønstre, tendenser og relationer, der kan føre til indsigt og forudsigelser.
Data mining vs. data science
Datavidenskab er ikke det samme som data mining, men begreberne er relaterede. Datavidenskab er et begreb, der omfatter mange informationsteknologier, herunder statistik, matematik og sofistikerede beregningsteknikker som anvendt på data. Data mining er en use case for data science med fokus på analyse af store datasæt fra en bred vifte af kilder med det formål at afdække nyttige indsigter.
Data mining vs. datawarehouse
Et datawarehouse er en samling af data, normalt fra flere kilder (ERP, CRM osv.), som en virksomhed vil kombinere til lageret for arkivlagring og bredt baserede analyser – som f.eks. data mining.
Ofte stillede spørgsmål
SAP PRODUCT
Forøg værdien af AI med data
Udnyt dine data for at opnå pålidelig og skalerbar ydeevne med SAP Business Data Cloud.