Posts mit dem Label Coursera werden angezeigt. Alle Posts anzeigen
Posts mit dem Label Coursera werden angezeigt. Alle Posts anzeigen

2014/07/27

Migrationsbilanz als ShinyApp

Für das Kurs-Projekt vom MOOC Developing Data Products habe ich eine simple Visualisierungs App entwickelt. Sie bereitet Migrationsdaten aus dem Zeitraum 2002 - 2012 der Bezirke von Oberösterreich in Form einer Choroplethenkarte auf und zeigt die Werte auch in Tabellenform.

Link zu shinyMig OÖ

ShinyApps.io

Umgesetzt wurde das Projekt zu Versuchszwecken in R auf der ShinyApps.io Plattform von RStudio. Das Deployment hierbei zeigte sich mehr als simpel. Sofern die Anwendung auf der eigenen Workstation einwandfrei läuft, kann es mit einem einfachen deployApp() Befehl auf die Plattform geladen werden. Die Kunst ist lediglich, die Anwendung am eigenen Rechner fehlerfrei zum Laufen zu bringen, da die debugging Möglichkeiten mit shiny leider noch sehr begrenzt sind.

Umsetzung in R

Bei der Entwicklung der App zeigte sich wieder eindeutig, dass R nur ein suboptimales Werkzeug zur Kartenerstellung ist. Mit ggplot2 ist zwar einiges möglich, der Aufwand dafür steht jedoch mMn nicht in Relation zu den mässigen Ergebnissen im Vergleich zu echter GIS-Software. Bei der Aufbereitung der Rohdaten (übrigen von data.gv.at) und der tabellarischen Darstellung in der App, konnte hingegen R natürlich seine Stärken ausspielen. Als größtes Hindernis bei der Entwicklung stellte sich die Kategorisierung der Migrationsbilanzen heraus, wobei ich mich nach etlichen Versuchen in automatischer- und einiger in manueller-Klassifizierung für einen semi-automatischen Weg entschieden habe, wobei positive und negative Salden getrennt und von diesen beiden Kategorien dann der jeweilige Median als weitere Schwelle eingeführt wurde. Damit blieb die visuelle Vergleichbarkeit der Karten noch einigermassen erhalten, bei Beibehaltung des Akzents auf die Trennung von positiven und negativen Werten. Für detaillierte Vergleiche sind ja noch die jeweiligen Schwellen in der Legende verzeichnet bzw. auch die Daten in der Tabelle ersichtlich.

Beispielcode

Der Beispielcode steht im R-Repo dieses Blogs zum download bereit.

2014/05/01

YouTube Kanal: IRiSS

Das Institute for Research in the Social Sciences der Stanford Universität hat einen eigenen YouTube Kanal, auf den vor allem Konferenzbeiträge zu Themen der computergestützen Sozialforschung öffentlich zugänglich gemacht werden. In den Vorträgen werden neue Methoden und theoretische Zugänge zum Thema vorgestellt. Einige Vortragende sind auch von Online Kursen von Coursera bekannt, von Daniel A. McFarland (Oranizational Analysis), Lada Adamic (Social Network Analysis) und Scott Klemmer (Human-Computer Interaction) habe ich schon MOOCs absolviert, die ich jeweils sehr empfehlen kann.

Wer also nach Inspiration für die Entwicklung von Anwendungen in der computergestützten Sozialforschung sucht, kann sich hier inspieren lassen.

2014/04/08

MOOC: The Data Scientist's Toolbox

Diese Woche habe ich wiedermal einen MOOC zum Thema Data Science begonnen. Dies ist der Einstiegskurs zu den, in einem früheren Post erwähnten, Data Science Specialization Kursen von Coursera.

Leider war aus der Kursbeschreibung nicht ersichtlich, dass es sich dabei um eine reine Einführung in (und Werbung für) diese neue Specialization-Schiene handelt und nicht etwa um eine umfassende Beschreibung von relevanten Werkzeugen, wie der Titel vermuten lassen könnte.
Thematisch handeln die Lektionen von der Installation nötiger Software (va. R für die Analyse und Git zur Versionskontrolle) und ein wenig einführender Worte zur Arbeit mit Daten. Der Arbeitsaufwand ist entsprechend gering - aktuell, habe ich alle Erfordernisse, abgesehen von der Benotung der Peers, mit einem Zeitaufwand von ca. 4h hinter mich gebracht. Etwas dürftig für einen 4 wöchigen Kurs ;)
Der Kurs ist für Datenwissenschaften-Interessierte als Zeitverschwendung anzusehen. Immerhin sollte davon ausgegangen werden können, dass jemand, der/die sich datenanalytisch betätigen möchte, gut dokumentierte Programme installieren kann.

2014/02/02

MOOC: Computing for Data Analysis

Nachdem ich beschlossen habe, dass meine Fähigkeiten, mit R zu arbeiten, erweiterungsfähig sind, habe ich mich in den Coursera-MOOC Computing for Data Analysis eingeschrieben. Im Herbst habe ich schonmal einen Coursera-MOOC zur Datenanalyse mit R belegt, aber gleichmal zu Beginn wieder abgebrochen, da mir der Inhalt dann doch zu grundlegend war. Bei diesen habe ich nun erwartet, ein paar Tipps & Tricks in der Skriptprogrammierung und Möglichkeiten zur Übung zu erhalten. Nachdem der Kurs nun abgeschlossen ist, mein Résumé:

Die Ausrichtung des Kurses finde ich nicht recht schlüssig. Einem/r EinsteigerIn ist er mMn nicht zu empfehlen, da gar nicht genügend Zeit bleibt, in einem so kompakte Zeitrahmen von 4 Wochen, die gelernten Techniken so einzuüben, um sie auch produktiv einsetzen zu können. Andererseits langweilt sich der/die Nicht-EinsteigerIn in der ersten Woche (Einführung, Installation etc.) und auch bei den Grundlagen zum Plotten.

Der Vortrag von Roger D. Peng (Assoc. Prof. an der Johns Hopkins Bloomberg School of Public Health) ist inhaltlich gut zusammengestellt und auch gut verständlich. Die Lektionen selbst sind teilweise etwas lang und könnten besser in mehrere Lektionen aufgesplittet werden. Thematisch wurde es erst gegen Ende der dritten (Reproduzierbare Forschung) und in der letzten Woche (Reguläre Ausdrücke in R bzw. S3- & S4 Klassen/-Methoden) richtig spannend.

Quizzes sind gut lösbar, aber auch nicht unterfordernd. Richtig negativ sind mir eigentlich nur die Program Assignments aufgefallen. Deren Angaben sind teilweise mangelhaft und es gibt kein nützliches Feedback (nur ob das abgegebene Dokument "korrekt" war oder eben nicht - jedoch kein Hinweis, was daran nicht korrekt war). Zudem sind die Fragen aufeinander aufgebaut. Kann also das erste Beispiel nicht korrekt gelöst werden, sind auch die übrigen Punkte verloren. Das Positive an den Assignments ist, dass sie eine gute Möglichkeit zum Training der Skriptprogrammierung mit R bieten. Die Beispiele sind mit ein bisschen Übung (und kompletter Anleitung) nicht unlösbar. Außerdem sind mMn die Domänen der jeweiligen Assignments gut gewählt, damit sie nicht allzu langweilig werden. Für diesen Blog relevant, war beispielsweise die Assignments 3 und 4, in denen im Ersten gesundheitsrelevante Datensätze (Gesundheits-Outcome- und Spitaldaten aus den USA) und im Zweiten ein Datensatz zur Kriminalität (Tötungsdelikte in Baltimore) zu bearbeiten waren. Die Datensätze waren dabei jeweils schon aufbereitet.

Alles in Allem, war es eine gute Möglichkeit zur Übung. Im Bereich von Tipps & Tricks hätte ich mir aber mehr erhofft. Vielleicht wird der Kurs in Rahmen des neuen Spezialiserungs-Programms hinsichtlich dieser Richtung ja noch verbessert. Und nun werde ich auf das Statement of Accomplishment warten ;)

2014/01/22

Coursera´s Data Science Specialization

Nachdem Ende letzten Jahres der MOOC Anbieter Udacity eine Serie von neuen MOOC´s zum Thema Data Science angekündigt hat (die jedoch noch immer nicht Online sind), zog Heute Coursera nach und veröffentlichte eine neue Angebotsschiene. Dabei werden verschiedene Kurse zu einem Thema gebündelt. Werden diese positiv absolviert, wird ein spezielles Zertifikat ausgestellt. Eine dieser Specializations ist Data Science, die in Zusammenarbeit mit der Johns Hopkins Universität realisiert wurde.

Ab April werden die ersten Kurse starten, die alle in Englisch gehalten werden. Neun davon sind zu absolvieren und ein sogenanntes Capstone Project muss am Ende auch noch als Abschlussarbeit erstellt werden. Die Themen der jeweils vierwöchigen Kurse decken das breite Spektrum an Fähigkeiten, die DatenwissenschafterInnen haben sollten, ganz gut ab. Es wird ein Kurs zur Sammlung und Aufbereitung von Daten angeboten, eine Reihe von Kursen zu diversen Analysmethoden, ein Kurs über Machine Learning und einer über die Herstellung von Datenprodukte. Wie aus den Beschreibungen heraus zu lesen ist, sind alle Kurse sehr auf R als Analysewerkzeug ausgerichtet. Die Auswahl der Kursleiter Roger D. Peng, Jeff Leek und Brian Caffo, die alle schon in letzter Zeit Kurse über (oder mit) R auf Coursera gehalten haben, ist wohl auch als Indiz dafür zu werten.

Für jene, die ein solches Specialization Certificate erhalten möchten, beträgt die Kursgebühr jeweils 49$ pro Kurs - was also insgesamt 441$ macht. Ist einem ein solches Zertifikat das nicht wert oder gefällt die Kurszusammenstellung nicht, können die Kurse jedoch auch einzeln und kostenlos absolviert werden.

Da meine Erfahrung von früheren Coursera Kursen ist, dass sie ganz gut geeignet sind, um Wissen aufzufrischen und sich mit aktuellen Entwicklungen vertraut zu machen, habe ich vor, das freie Angebot von The Data Scientist´s Toolbox, Practical Machine Learning und Developing Data Products zu absolvieren und falls es die Zeit (bzw. die Anforderungen der Kurse) zu lässt, eventuell auch noch ein, zwei Kurse über die Analysemethoden.