En fotballspiller tar ti straffespark. Hvor sannsynlig er det at spilleren scorer på akkurat åtte? En binomisk modell kan hjelpe oss å regne det ut.
Modellen teller hvor mange ganger et bestemt utfall, kalt suksess, inntreffer. Før du bruker den, må du sjekke fire forutsetninger.
Når kan du bruke binomisk fordeling?
Fire krav må være oppfylt:
- Fast antall forsøk, kalt n. Ti straffespark, ikke «så mange som det tar».
- To mulige utfall per forsøk: suksess eller ikke suksess. Mål eller bom.
- Samme suksessannsynlighet p i hvert forsøk. I straffesparkeksempelet antar vi at scoringssannsynligheten er uendret.
- Forsøkene er uavhengige. Å vite utfallet av ett skudd endrer ikke sannsynligheten for mål på det neste.
Hvis forutsetningene ikke er oppfylt, er binomisk fordeling ikke en nøyaktig modell. Ved trekking av kort uten tilbakelegging endres for eksempel sannsynligheten underveis. Straffespark er også en forenkling: i virkeligheten kan press og tretthet påvirke skuddene.
Hva betyr X, n og p?
Vi lar X være antall suksesser. X er en tilfeldig variabel fordi vi ikke vet resultatet på forhånd. Med n forsøk kan X få verdiene 0, 1, 2 og så videre opp til n.
n er antall forsøk, og p er sannsynligheten for suksess i hvert forsøk. Du kan skrive X\sim\operatorname{Bin}(n,p). Det betyr at X er binomisk fordelt med disse to verdiene.
Formelen
Sannsynligheten for nøyaktig k suksesser i n forsøk:
P(X=k)=\binom{n}{k}p^k(1-p)^{n-k}De tre delene gjør hver sin jobb:
Binomialkoeffisienten C(n, k), som også skrives \binom{n}{k}, teller hvor mange måter k suksesser kan plasseres blant n forsøk. Den regnes som \binom{n}{k}=\frac{n!}{k!(n-k)!}. Utropstegnet betyr fakultet: for eksempel er 4! = 4 × 3 × 2 × 1 = 24. Vi definerer 0! = 1.
Dette er et eksempel på kombinatorikk: Vi teller hvor mange valg av plasseringer som gir det samme antallet suksesser.
p^k er sannsynligheten for suksess i k bestemte forsøk når forsøkene er uavhengige.
(1-p)^{n-k} gjelder de resterende forsøkene uten suksess. Produktet p^k(1-p)^{n-k} gir sannsynligheten for én bestemt rekkefølge. Derfor må vi også gange med antall mulige rekkefølger.
Regneeksempel: straffesparkene
Vi antar at scoringssannsynligheten er p = 0,8 i hvert av ti uavhengige straffespark. Hvor sannsynlig er det å score på nøyaktig åtte?
Her er n = 10, k = 8 og p = 0,8.

Spilleren kan bomme på de to første, de to siste, eller én gang i starten og én mot slutten. Det finnes 45 ulike rekkefølger som ender med 8 mål og 2 bom.
0{,}8^8=0{,}16777216\qquad\text{og}\qquad0{,}2^2=0{,}04 P(X=8)=45\cdot0{,}8^8\cdot0{,}2^2=0{,}301989888\approx30{,}2\,\%Det er altså omtrent 30,2 prosent sannsynlighet for nøyaktig åtte mål med disse forutsetningene. Det er ikke det samme som sannsynligheten for minst åtte mål; da må du også ta med ni og ti mål.
For nøyaktig tre mål blir sannsynligheten omtrent 0,079 prosent med samme modell. Det er et sjeldent utfall, men ikke umulig. Et slikt resultat kan gi grunn til å undersøke forutsetningene nærmere; det beviser ikke alene at modellen er feil.
En formell undersøkelse av en påstand om suksessannsynligheten kan gjøres med en hypotesetest. Før du regner, må du velge om spørsmålet krever en ensidig eller tosidig hypotesetest.

Forventningsverdi og standardavvik
To formler beskriver gjennomsnittet og spredningen i modellen:
\begin{aligned}E(X)&=np\\\sigma&=\sqrt{np(1-p)}\end{aligned}For straffesparkene:
\begin{aligned}E(X)&=10\cdot0{,}8=8\text{ mål}\\\sigma&=\sqrt{10\cdot0{,}8\cdot0{,}2}=\sqrt{1{,}6}\approx1{,}26\end{aligned}Forventningsverdien 8 betyr at gjennomsnittet ville nærmet seg åtte mål per serie hvis vi gjentok svært mange serier med ti spark under samme forhold. Det betyr ikke at hver serie gir åtte mål. Standardavviket beskriver hvor mye antall mål typisk varierer rundt forventningsverdien.
Normaltilnærming og sentralgrenseteoremet
Sentralgrenseteoremet forklarer hvorfor summer og gjennomsnitt ofte kan tilnærmes med en normalfordeling. I en vanlig versjon forutsetter vi uavhengige observasjoner fra samme fordeling, med endelig forventningsverdi og varians.
Tenk deg at vi trekker mange tilfeldige utvalg av studenter og regner gjennomsnittlig søvnlengde i hvert utvalg. Gjennomsnittene vil variere fra utvalg til utvalg.
Når hvert utvalg er stort nok og forutsetningene er oppfylt, kan fordelingen av gjennomsnittene bli omtrent normalfordelt. Hvor stort utvalget må være, avhenger blant annet av hvor skjev den opprinnelige fordelingen er. Tallet 30 er ingen universell garanti.
Det er gjennomsnittene som kan få en omtrent normal fordeling. Det betyr ikke at søvnlengden til hver enkelt student blir normalfordelt, eller at et skjevt utvalg automatisk blir representativt.
En binomisk variabel er en sum av uavhengige forsøk med verdiene 0 og 1. Derfor kan den ofte normaltilnærmes når både np og n(1-p) er store nok. En vanlig tommelfingerregel er minst 5, mens strengere regler bruker 10. Ved beregninger bør du også bruke kontinuitetskorreksjon: for eksempel tilnærmes P(X\le k) med arealet opp til k+0{,}5 i normalmodellen. Bruk gjerne den eksakte binomiske sannsynligheten når den er enkel å beregne.
Kort oppsummert
Bruk binomisk fordeling når du teller suksesser i et fast antall uavhengige forsøk, med to utfall og samme suksessannsynlighet hver gang. Formelen kombinerer sannsynligheten for én rekkefølge med antall mulige rekkefølger. Forventningsverdien er np. Skill mellom nøyaktig, minst og høyst et bestemt antall suksesser.
Se forklaringen på video
Vil du se temaet forklart? Åpne videoleksjonen «Bernoulli forsøksrekke og binomisk fordeling» i EnkelEksamen. Du må logge inn, og enkelte leksjoner krever tilgang til faget.
Vil du jobbe videre med faget? Se innholdet i Statistikk ved NTNU, eller finn faget som passer til ditt studiested.
TMA4245, TMA4240
Statistikk – NTNU

