Multipele regressie analyse - Multipele lineaire regressieanalyse
3 belangrijke vragen over Multipele regressie analyse - Multipele lineaire regressieanalyse
Steekproevenverdeling - multipele regressieanalyse
- Zoals alles dat kan worden berekend uit een steekproef hebben ook de parameters in het regressiemodel (b0, b1, b2, bn), en de proportie verklaarde variantie (R2), een steekproevenverdeling
- De steekproevenverdeling van de regressiecoëfficiënten (b's) is een t-verdeling
- Voor R2 wordt vaak de F-verdeling gebruikt
- Die F-verdeling helpt om de p-waarde te berekenen
- die p-waarde geeft aan hoe groot de kans is op de gevonden R2 als er in de populatie geen samenhang is tussen voorspellers en afhankelijke variabele
- Dit wordt gebruikt binnen nulhypothesesignificantietoetsing (NHST)
Aannames van multipele regressie
- Zelfde basisassumpties als enkelvoudige regressie, plus een extra aanname
- 1. Continue meetniveau
- De variabelen moet een continu meetniveau hebben
- Dus interval- of ratio schaal
- 2. Lineariteit
- Het verband tussen de voorspellers en afhankelijke variabele moet lineair zijn
- Dat betekent dat de toe- of afname van de afhankelijke variabele constant moet zijn bij veranderingen in de voorspeller(s)
- 3. Onafhankelijkheid
- Alle observaties moeten onafhankelijk van elkaar zijn
- De onderzoekseenheden mogen elkaar dus niet beïnvloeden
- 4. Normaliteit
- De error/ruis moet normaal verdeeld zijn
- Voor elke waarde van de voorspeller hoort de afhankelijke normaal verdeeld te zijn
- 5. Homoscedasticiteit
- Er moet sprake zijn van gelijke varianties van de fouten
- Dit heet homoscedasticiteit
- Je kunt dit controleren met:
- Een scatterplot, of
- Met een toets, zoals Levene's test
- Als punten bijvoorbeeld in een trechtervorm rond de regressielijn liggen, is homoscedasticiteit geschonden
- 6. Geen multicollineariteit
- Er mag geen sprake zijn van multicollineariteit
- Als je een regressie analyse doet waarbij je de ene voorspeller voorspelt uit de andere voorspellers (waarbij dus de afhankelijke variabele buiten beschouwing wordt gelaten), en de R2 is hoog, dan is er sprake van multicollineariteit
- Als voorspellers te veel overlap hebben:
- Is er minder unieke informatie beschikbaar in het model
- Worden de standaardfouten groter
- Worden de betrouwbaarheidsintervallen breder
- Daardoor kun je minder goed conclusies trekken over:
- Hoeveel variantie elke voorspeller uniek verklaart
- En hoe de regressievergelijking precies geïnterpreteerd worden
- Bij multicollineariteit kun je vaak nog wel zeggen hoeveel variantie in totaal wordt verklaaard, maar je kunt niet meer goed zeggen welke voorspeller daar vooral verantwoordelijk voor is.
Kort samengevat - multipele regressieanalyse
- Multipele regressie = regressie met meerdere voorspellers
- R2 = proportie verklaarde variantie door alle voorspellers samen
- b’s hebben een t-verdeling
- R2 wordt vaak getoetst met de F-verdeling
- Belangrijke extra aanname: geen multicollineariteit
- Bij overlap tussen voorspellers zijn losse regressiecoëfficiënten lastig of niet valide te interpreteren
- R2 blijft dan vaak nog wel zinvol
De vragen op deze pagina komen uit de samenvatting van het volgende studiemateriaal:
- Een unieke studie- en oefentool
- Nooit meer iets twee keer studeren
- Haal de cijfers waar je op hoopt
- 100% zeker alles onthouden















