Hva er forklart varians?

I dette innlegget skal vi dykke ned i konseptet R^2, et nøkkelelement i regresjonsanalyse som forteller oss hvor godt modellen vår forklarer dataene. R^2 går under flere navn: det er også kjent som forklaringsgrad, determinasjonskoeffisient eller «forklart varians». R^2 uttales «R kvadrert» eller «R i annen».

R^2, enkelt forklart

illustrasjonsbilde: spredning og signifikans. forklart varians

R², også kalt forklaringsgrad, beskriver hvor stor andel av variasjonen i den avhengige variabelen modellen forklarer i datasettet. Det er et mål på tilpasning til dataene, ikke en garanti for gode prediksjoner på nye observasjoner.

Ved vanlig minste kvadraters regresjon med konstantledd ligger R² mellom 0 og 1 på dataene modellen er tilpasset til. R² = 0 betyr at modellen ikke reduserer kvadratsummen av feil sammenlignet med å bruke gjennomsnittet. R² = 1 betyr perfekt tilpasning. Uten konstantledd eller ved vurdering på nye data kan R² også bli negativ.

Et eksempel – hvor godt kan vi forutsi studenters karakterer?

La oss si at vi har gjennomført en studie for å se om det er en sammenheng mellom antall timer studert og karakterene oppnådd av studentene. Hvis vi beregner en R^2 på 0.6 for denne studien, betyr det at 60% av variansen i karakterene kan forklares av antall timer studert. Om dette er en høy eller lav forklaringsgrad, avhenger av fagfeltet og formålet. Sammenhengen viser ikke i seg selv at flere studietimer forårsaker bedre karakterer. Hvis vi derimot beregner en R^2 på 0, betyr det at modellen ikke kan forklare noen av variasjonene i karakterene. Sagt på en annen måte: modellen predikerer ikke studenters karakterer bedre enn bare å gjette gjennomsnittet av karakterer i klassen.

illustrasjonsbilde: fra karakter f til a

En nyttig måte å tolke R² på er å sammenligne modellens kvadrerte avvik med avvikene fra gjennomsnittet. En høyere verdi betyr bedre tilpasning til akkurat disse dataene. Men R² kan øke bare fordi vi legger til flere forklaringsvariabler. Vurder derfor også justert R², residualene og hvor godt modellen fungerer på nye data.

R^2 i enkel og multippel regresjon

R^2 kan brukes både i enkel og multippel regresjon. I enkel regresjon, hvor vi bare har én uavhengig variabel, forteller R^2 oss hvor mye av variansen i den avhengige variabelen som kan forklares av den uavhengige variabelen.

I multippel regresjon, hvor vi har mer enn én uavhengig variabel, forteller R^2 oss hvor mye av variansen i den avhengige variabelen som kan forklares av alle de uavhengige variablene tatt sammen.

Jeg håper denne forklaringen har gitt deg en bedre forståelse av R^2 og dens rolle i regresjonsanalyse.

Ønsker du å lære mer om statistikk og metode, kan du finne utfyllende undervisning i statistikk nedenfor – sjekk det ut!

Finn ditt Statistikk for økonomer-fag tilpasset ditt studiested

Statistikk for økonomer

MET 2920

Statistikk for økonomer

Statistikk for økonomer - NHH

MET2

Statistikk for økonomer – NHH

Statistikk

MET 3431

Statistikk

Statistikk (siviløkonom)

MET 1190

Statistikk (siviløkonom)

Statistikk for økonomer - Høgskolen i Innlandet

ØKA1026, 3MET130, SMET130, HMET130

Statistikk for økonomer – Høgskolen i Innlandet

Statistikk for økonomer - HVL

BØA115

Statistikk for økonomer – HVL

Statistikk for økonomer - Kristiania

SFO1100

Statistikk for økonomer – Kristiania

Statistikk for økonomer - NTNU

SØK1004, REA1154, AR100219, MET1002

Statistikk for økonomer – NTNU

Statistikk for økonomer - USN

MET1010

Statistikk for økonomer – USN

Statistikk - NLA Høgskolen

HSM103

Statistikk – NLA Høgskolen

Statistikk - OsloMet

ØAMET1100

Statistikk – OsloMet

Husk også at R² bare måler samvariasjon, hva som eventuelt forårsaker hva må vurderes separat: les mer i artikkelen om korrelasjon og kausalitet.

Ofte stilte spørsmål

Hva betyr en forklaringsgrad på 0,6?
I en vanlig lineær regresjon med konstantledd betyr R² = 0,6 at modellen forklarer 60 prosent av variasjonen i den avhengige variabelen i datasettet. Det viser ikke i seg selv at sammenhengen er kausal.
Er høy R² alltid et tegn på en god modell?
Nei. Høy R² beskriver god tilpasning til dataene som er brukt, men garanterer ikke gode prediksjoner på nye data. Vurder også modellforutsetninger, residualer og om modellen er blitt unødvendig komplisert.