Statistische methoden zijn een cruciaal onderdeel van data science, toch hebben weinig data scientists een formele statistische opleiding.. Cursussen en boeken over basisstatistiek behandelen het onderwerp zelden vanuit een datawetenschappelijk perspectief.. De tweede editie van deze populaire gids voegt uitgebreide voorbeelden in Python toe, biedt praktische begeleiding bij het toepassen van statistische methoden op data science, vertelt u hoe u misbruik ervan kunt voorkomen en geeft u advies over wat belangrijk is en wat niet.
Veel data sciencebronnen bevatten statistische methoden, maar missen een dieper statistisch perspectief.. Als je bekend bent met de programmeertalen R of Python en enige kennis hebt van statistiek, overbrugt deze snelle referentie de kloof in een toegankelijk, leesbaar formaat.
Met dit boek leer je:
Waarom verkennende data-analyse een cruciale voorbereidende stap is in data science
Hoe willekeurige steekproeven bias kunnen verminderen en een dataset van hogere kwaliteit kunnen opleveren, zelfs bij big data
Hoe de principes van experimenteel ontwerp definitieve antwoorden op vragen opleveren
Hoe regressie te gebruiken om uitkomsten te schatten en afwijkingen te detecteren
Belangrijke classificatietechnieken voor het voorspellen tot welke categorie een record behoort
Statistische machine learning methoden die "leren" van data
Onbegeleide leermethoden voor het extraheren van betekenis uit ongelabelde gegevens
Over de auteur
Peter Bruce is de Oprichter en Chief Academic Officer van het Institute for Statistics Education bij Statistics.com, dat ongeveer 80 cursussen aanbiedt in statistiek en analyse, waarvan ongeveer de helft gericht is op data scientists.. Hij heeft verschillende boeken over statistiek en analyse geschreven of mede geschreven, en hij behaalde zijn Bachelor's degree aan Princeton, en zijn Master's degrees aan Harvard en de Universiteit van Maryland.
^
Andrew Bruce, Principal Research Scientist bij Amazon, heeft meer dan 30 jaar ervaring in statistiek en data science in de academische wereld, de overheid en het bedrijfsleven.. De co-auteur van Applied Wavelet Analysis with S-PLUS, hij behaalde zijn bachelorgraad aan Princeton en zijn PhD in statistiek aan de Universiteit van Washington.
^
Peter Gedeck, Senior Data Scientist bij Collaborative Drug Discovery, is gespecialiseerd in de ontwikkeling van machine learning-algoritmen om biologische en fysisch-chemische eigenschappen van kandidaat-geneesmiddelen te voorspellen. Mede-auteur van Data Mining for Business Analytics, hij behaalde doctoraten in Scheikunde aan de Universiteit van Erlangen-Nürnberg in Duitsland en Wiskunde aan de Fernuniversität Hagen, Duitsland.