Full text
Studien zum Physikund Chemielernen H. Niedderer, H. Fischler, E. Sumfleth [Hrsg.] 209 Philipp Straube Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung bei (Lehramts-) Studierenden im Fach Physik λογος
StudienzumPhysik-undChemielernen Herausgegeben von Hans Niedderer, Helmut Fischler und Elke Sumfleth Diese Reihe im Logos-Verlag bietet ein Forum zur Ver¨offentlichung von wissenschaftlichen Studien zum Physikund Chemielernen. In ihr werden Ergebnisse empirischer Untersuchungen zum Physikund Chemielernen dargestellt, z. B. ¨uber Sch¨ulervorstellungen, Lehr-/Lernprozesse in Schule und Hochschule oder Evaluationsstudien. Von Bedeutung sind auch Arbeiten ¨uber Motivation und Einstellungen sowie Interessensgebiete im Physikund Chemieunterricht. Die Reihe f¨uhlt sich damit der Tradition der empirisch orientierten Forschung in den Fachdidaktiken verpflichtet. Die Herausgeber hoffen, durch die Herausgabe von Studien hoher Qualit¨at einen Beitrag zur weiteren Stabilisierung der physikund chemiedidaktischen Forschung und zur F¨orderung eines an den Ergebnissen fachdidaktischer Forschung orientierten Unterrichts in den beiden F¨achern zu leisten. Hans Niedderer Helmut Fischler Elke Sumfleth
Philipp Straube Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung bei (Lehramts-) Studierenden im Fach Physik Logos Verlag Berlin λογος
Dissertation, Freie Universit¨ at Berlin, 2016 Bibliografische Information der Deutschen Nationalbibliothek Die Deutsche Nationalbibliothek verzeichnet diese Publikation in der Deutschen Nationalbibliografie; detaillierte bibliografische Daten sind im Internet ¨uber http://dnb.d-nb.de abrufbar. c Copyright Logos Verlag Berlin GmbH 2016 Alle Rechte vorbehalten. 978-3-8325-4351-8 Logos Verlag Berlin GmbH Comeniushof, Gubener Str. 47, D-10243 Berlin Germany Tel.: +49 (0)30 / 42 85 10 90 Fax: +49 (0)30 / 42 85 10 92 http://www.logos-verlag.de
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung bei (Lehramts-) Studierenden im Fach Physik Dissertation zur Erlangung des Grades eines Doktors der Naturwissenschaften am Fachbereich Physik der Freien Universität Berlin vorgelegt von Philipp Frederik Straube, M.Ed. aus Berlin Berlin, 2016
1. Gutachter: Prof. Dr. Volkhard Nordmeier 2. Gutachter: Prof. Dr. Andreas Borowski Tag der Disputation: 15. September 2016
"The assessment of professional competence is a difficult and, in many ways, a very frustrating task." (Michael T. Kane)
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 2 Inhalt 1. Einleitung .................................................................................................................................5 1.1 Vorarbeiten und Anschlussfähigkeit .............................................................................8 2. Theoretische Grundlagen .......................................................................................................9 2.1 Definition von Kompetenz ............................................................................................9 2.1.1 Kompetenzmodelle .............................................................................................. 11 2.2 Professionelle Kompetenz von Lehrerinnen und Lehrern ..................................... 12 2.3.1 Der Einfluss von Subject Matter (Content) Knowledge ................................. 15 2.3.2 Syntactic Knowledge (SK) ................................................................................... 16 2.3.3 Einfluss von SK auf den Unterricht ................................................................... 19 2.3.4 Zusammenfassung ................................................................................................ 20 2.4 Erkenntnisgewinnung aus normativer Sicht ............................................................. 21 2.5 Scientific Inquiry: Erkenntnisgewinnung aus wissenschaftstheoretischer Perspektive ................................................................................................................................ 22 2.5.1 Die Induktion ........................................................................................................ 22 2.5.2 Poppers Falsifikationismus .................................................................................. 23 2.5.3 Kuhn’s wissenschaftliche Revolutionen ............................................................ 25 2.5.4 Lakatos Forschungsprogramme.......................................................................... 27 2.5.5 Zusammenfassung ................................................................................................ 30 2.5.6 Folgerungen für ein Kompetenzmodell ............................................................ 32 2.6 Scientific Reasoning: Handlungsmodell der Erkenntnisgewinnung ...................... 33 3. Entwicklung eines Kompetenzstrukturmodells wissenschaftlicher Erkenntnisgewinnung ................................................................................................................. 37 3.1 Scientific Reasoning nach Mayer ................................................................................ 39 3.2 Modellkompetenz ......................................................................................................... 40 3.3 Kompetenzstrukturmodell .......................................................................................... 40 3.4 Operationalisierung der Kompetenzen ..................................................................... 41 3.4.1 Dimension: Naturwissenschaftliche Untersuchungen ..................................... 41 3.4.2 Modelle Nutzen ..................................................................................................... 44 4. Forschungsfragen und Hypothesen ................................................................................... 47 4.1 Frage zur Dimensionierung des Kompetenzstrukturmodells ................................ 48 4.2 Fragen zum Kompetenzstand von Physikstudierenden .......................................... 50 4.3 Fragen zum Kompetenzstand von Studierenden im Fach „Integrierte Naturwissenschaften“ .............................................................................................................. 53
Einleitung 3 4.4 Frage zum Kompetenzstand von Studierenden der Sozialkunde .......................... 54 5. Methoden .............................................................................................................................. 55 5.1 Verfahren zur Testkonstruktion ................................................................................. 55 5.1.1 Formate zur Erfassung von Kompetenzen ....................................................... 55 5.1.2 Entscheidung für ein Erhebungsverfahren ....................................................... 56 5.1.3 Itemkonstruktion .................................................................................................. 57 5.2 Statistische Verfahren zur Auswertung ..................................................................... 59 5.2.1 Das RASCH-Modell ............................................................................................... 60 5.2.2 Normierung ........................................................................................................... 62 5.2.3 Personenparameterschätzung .............................................................................. 63 5.2.4 Latentes Regressionsmodell ................................................................................ 64 5.2.5 Dimensionsanalyse ............................................................................................... 65 5.2.6 Differential Item Functioning (DIF) .................................................................. 65 5.2.7 Mittelwertsvergleiche ............................................................................................ 66 5.2.8 Prüfung von Normalverteilung und Varianzhomogenität .............................. 67 5.2.9 Effektstärken ......................................................................................................... 68 6. Testkonstruktion .................................................................................................................. 69 6.1 Vorgehen bei der Aufgabenkonstruktion .................................................................. 69 6.1.1 Prä-Pilotierung und Pilotierung .......................................................................... 71 6.2 Konstruktionsbeispiele ................................................................................................ 72 6.2.1 Aufgabenbeispiel 1: „Hypothese“ ...................................................................... 72 6.2.2 Aufgabenbeispiel 2: „Planung und Durchführung“ ......................................... 76 6.2.3 Aufgabenbeispiel 3: „Auswertung und Interpretation“ ................................... 81 6.2.4 Aufgabenbeispiel 4: „Zweck von Modellen“ .................................................... 86 6.3 Beschreibung des fertigen Tests ................................................................................. 90 6.3.1 Testgüte .................................................................................................................. 92 7. Auswertung ........................................................................................................................... 95 7.1 Beschreibung der Stichprobe ...................................................................................... 95 7.2 Fragestellung 1: Dimensionierung des Kompetenzstrukturmodells ..................... 97 7.3 Fragestellungen zum Kompetenzstand von Physikstudierenden ........................ 100 7.3.1 Vorbereitung der Daten ..................................................................................... 100 7.3.2 Differential Item Functioning (DIF) ................................................................ 102 7.3.3 Normierung ......................................................................................................... 103
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 10 volitionale Aspekte zu ihrem Kompetenzbegriff, räumen aber auch ein, dass man sich bei der Erfassung von Handlungskompetenzen auf Teilaspekte beschränken muss. Explizit für die universitäre Lehramtsausbildung definiert die Kultusministerkonferenz (2010) Kompetenz als „Kenntnisse, Fähigkeiten, Fertigkeiten und Einstellungen, über die eine Lehrkraft zur Bewältigung ihrer Aufgaben im Hinblick auf das jeweilige Lehramt verfügen muss“. Alternativ bietet sich eine Definition an, die im Rahmen des DFG Schwerpunktprogramms "Kompetenzmodelle zur Erfassung individueller Lernergebnisse und zur Bilanzierung von Bildungsprozessen" entwickelt wurde. Demnach sind Kompetenzen „kontextspezifische kognitive Leistungsdispositionen, die sich funktional auf Situationen und Anforderungen in bestimmten Domänen beziehen“ und erlernund vermittelbar sind (Klieme & Leutner, 2006, S. 4). In diesem Zusammenhang weisen die Autoren auf die besondere Bedeutung der Kontextabhängigkeit hin. Bei der Betrachtung von verschiedenen Kompetenzdefinitionen identifiziert Kane (1992) zwei Komponenten: “One component is the domain of possible encounters that the professional is expected to manage effectively and the other includes the knowledge, skills, and judgment that the professional is expected to use in managing these encounters.“ (Kane, 1992, S. 166) Unterschieden werden also zum einen die Umstände, in denen die Kompetenz angewendet werden muss und zum anderen die eigentlichen Fähigkeiten. Diese zwei Komponenten zeigen sich auch in den oben genannten Definitionen, wobei vom Detailreichtum, dem zweiten Teil der Kane'schen Unterscheidung deutlich mehr Raum gewährt wird. Die von Kane (1992) genannten Umstände werden in der Weinertschen Definition als „variable Situationen“ berücksichtigt. Bei Pisa wird Kompetenz als „mehr oder minder bereichsspezifisch[.]“ und bei Klieme & Leutner als „kontextspezifisch“ bezeichnet. In der Definition der KMK (2010) für das Lehramt wird eine Einschränkung auf die bestimmten Umstände nicht vorgenommen. Es wird lediglich darauf verwiesen, dass diese „auf das jeweilige Lehramt“ bezogen sind. Die Frage, wie ähnlich die genannten Kontexte zu fassen sind, ist ein kritischer Punkt bei der Modellierung von Kompetenzen (Hartig, 2008). Hierbei können einerseits zu enge Definitionen dazu führen, dass sämtliche einzelnen Handlungen zu einer Kompetenz werden (z.B. Geräteeinschalt-Kompetenz). Andererseits kann ein zu breites Konstrukt
Theoretische Grundlagen 11 sowohl zu Problemen bei der Definition, als auch beim Rückschluss auf bestimmte Bildungsmaßnahmen führen (Hartig, 2008). Hartig und Klieme (2006, S. 129) betonen dazu, dass Kompetenzen „in einem gewissen Maß über ähnliche Situationen generalisierbar sind“ und Hartig (2008, S. 21) definiert den Begriff Kontext als „eine Menge hinreichend ähnlicher realer Situationen, in denen bestimmte, ähnliche Anforderungen bewältigt werden müssen“. In Zusammenhang mit der Definition von Kompetenz wird auch immer ihr Unterschied zu generellen kognitiven Fähigkeiten betont (Hartig, 2008; Klieme, Maag-Merki & Hartig, 2007). Der Kompetenzbegriff grenzt sich gleich durch mehrere Faktoren von einer generellen kognitiven Fähigkeit wie Intelligenz ab. Zunächst werden Kompetenzen als erlernbar betrachtet, im Gegensatz zur Intelligenz, die als stabil und vererbbar betrachtet wird (Schweizer 2006, zitiert nach Hartig, 2008). Weiterhin ist Intelligenz losgelöst von inhaltlichem Vorwissen und daher auf neue Probleme anwendbar. Für Kompetenzen gilt dies nur für einen speziellen Kontext (Hartig, 2008). Aufgrund der Einschränkung auf kognitive Leistungsdispositionen, als auch der klaren Definition der Kontextspezifität wird in dieser Arbeit der Definition von Klieme und Leutner (2006) gefolgt. 2.1.1 Kompetenzmodelle Die Erfassung von Kompetenzen setzt ein theoretisches Modell voraus, anhand dessen die entsprechenden Messinstrumente konstruiert werden können. Grundsätzlich werden hierbei Kompetenzstrukturmodelle, die sich mit der Dimensionalität von Kompetenzen beschäftigen, sowie Kompetenzniveaumodelle, die verschiedene Ausprägungen einer Kompetenz fokussieren, unterschieden (Hartig & Klieme, 2006). Modelle erster Art strukturieren demnach die zu untersuchende Kompetenz. Die Unterteilung wird durch die zu bewältigenden Anforderungen vorgegeben (Hartig & Klieme, 2006). Teilkompetenzen „werden v. a. nach den Inhalten der interessierenden Situationen, der relevanten Aufgaben und den zur Lösung dieser Aufgaben zu bewältigenden Anforderungen definiert.“ (Hartig & Klieme, 2006, S. 131). Bei der Frage, wie detailliert man bestimmte Teilkompetenzen unterscheidet, sollte das Modell herangezogen werden, für das es auch fächerübergreifend den größten Konsens gibt (Mayer & Wellnitz, 2014). Ausgehend von der im Kompetenzmodell postulierten Struktur kann mit statistischen Methoden überprüft werden, inwiefern sich diese auch in den empirisch erhobenen Daten wiederspiegelt (Hartig & Höhler, 2010). Einerseits werden dadurch die theoretischen Annahmen geprüft, auf denen das Kompe-
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 12 tenzmodell fußt, andererseits wird es möglich, bei hohen Korrelationen zwischen einzelnen Teilkompetenzen auf eine einzelne Erfassung zu verzichten und diese als eine Skala zu behandeln (Hartig & Klieme, 2006). Zur Konstruktion von Kompetenzstrukturmodellen eignen sich zwei Verfahren: - zum einen die deduktive Methode, bei der aus der Theorie Handlungsmuster abgeleitet und beschrieben werden, die durch Expertenurteile abgesichert werden. - zum anderen das Kriteriumssampling, bei dem „[…] eine repräsentative Stichprobe von Verhaltensweisen ausgewählt […]“ und in Testaufgaben überführt wird (Hartig & Jude, 2007, S. 28). Kompetenzniveaumodelle sollen über eine reine normorientierte Beschreibung der Kompetenz von Personen hinausgehen. Innerhalb eines solchen Modells soll genau beschrieben werden, welche Anforderungen Personen mit einem bestimmten Kompetenzstand bewältigen können. Da es nicht praktikabel ist, dies für jeden Kompetenzstand einzeln zu beschreiben, werden mehrere Kompetenzstufen definiert, die einen bestimmten Bereich der Skala abdecken. Für diese Stufen werden dann die Anforderungen beschrieben (Hartig & Klieme, 2006, S. 133). 2.2 Professionelle Kompetenz von Lehrerinnen und Lehrern Die professionelle Handlungskompetenz von Lehrerinnen und Lehrern wird im Wesentlichen durch deklaratives, prozedurales und strategisches Wissen bestimmt (Baumert & Kunter, 2006). Für die Differenzierung der verschiedenen Wissens- (aber auch Könnens-) Bereiche gibt es verschiedene Modelle (für einen Überblick, siehe: Baumert & Kunter, 2006). Shulman (1987b) definiert verschiedene Kategorien von Teacher Knowledge, die er als Knowledge Base für Lehrerinnen und Lehrer bezeichnet. Neben allgemeinem Pädagogischen Wissen (PK) führt Shulman (1986a) drei zentrale Kategorien des Lehrerprofessionswissens an: Das Subject Matter Content Knowledge (SMK)4, das Pedagogical Content Knowledge (PCK) und das Curricular Knowledge. Grossman, Wilson und Shulman (1989) unterteilen das Subject Matter (Content) Knowledge, welches die eigentlichen Fachinhalte umfasst, in weitere Unterkategorien: - das Content Knowledge (CK), was die reinen fachlichen Inhalte umfasst, 4 Teilweise auch nur als Content Knowledge (Shulman, 1987b) oder Subject matter Knowledge (Grossman, Wilson und Shulman, 1989) bezeichnet.
Theoretische Grundlagen 13 - das Substantive Knowledge, welches sich auf die in einer Disziplin geltenden Annahmen und Paradigmen bezieht5, - die Beliefs about Subject Matter, die sich auf Vorstellungen über das Fachwissen beziehen, - sowie das Syntactic Knowledge (SK). Das Syntactic Knowledge befasst sich damit, wie in einer Wissenschaft neues Wissen generiert wird (Grossman et al., 1989, S. 27ff.): „The teacher need not only understand that something is so; the teacher must further understand why it is so, on what grounds its warrant can be asserted, and under what circumstances our belief in its justification can be weakened and even denied.” (Shulman, 1986a, S. 9). Neben einem positiven Einfluss des Syntactic Knowledge auf den Unterricht wird auch die Bedeutung für die spätere Aneignung von (neuem) Fachwissen für den Lehrenden selbst diskutiert (Grossman et al., 1989, S. 30). Der Bereich des Pedagogical Content Knowledge umfasst Wissen darüber, wie die entsprechenden Fachinhalte gelehrt werden können. Curriculum Content Knowledge betrifft Wissen, über die unterschiedlichen Wege curricular zu unterrichten (Shulman, 1986a, S. 10). In seinen späteren Ausführungen ergänzt er noch drei weitere Kategorien (Shulman, 1987b). Im deutschsprachigen Raum wird in der Forschung derzeit oftmals auf Shulmans Modell zurückgegriffen, wobei sich die drei Domänen Fachwissen, Fachdidaktisches Wissen und Pädagogisches Wissen durchgesetzt haben (Baumert & Kunter, 2006, S. 482). Auch Baumert und Kunter (2006) beziehen sich auf diese drei Bereiche, ergänzen ihr Modell aber noch um die zwei Aspekte Organisationsund Beratungswissen. In ihrer Begründung des Modells zeigen sie, dass die beiden wesentlichen Aspekte des Modells das Fachwissen und das Fachdidaktische Wissen sind (Baumert & Kunter, 2006, S. 496). Beide Autoren betonen die besondere Bedeutung des Fachwissens als „notwendige aber nicht hinreichende Bedingung für qualitätsvollen Unterricht und Lernfortschritte der Schülerinnen und Schüler […]. Fachwissen ist die Grundlage, auf der fachdidaktische Beweglichkeit entstehen kann“ (Baumert & Kunter, 2006, S. 496; siehe auch van Driel, Berry & Meirink, 2014, S. 861). Sie übersetzen den Bereich Fachwissen mit dem Shulman’schen Aspekt des Subject Matter Content Knowledge (Baumert & Kunter, 2006, S. 482). Viele Studien verwenden aber den Dreiklang PK, PCK 5 Vgl. Kuhn (1976b), siehe unten.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 14 und CK und übersetzen die fachwissenschaftliche Dimension damit als Content Knowledge (CK) (z.B. Cauet, Borowski & Fischer, 2015; Kirschner, 2013). Knowledge ist in diesem Zusammenhang aber nicht nur in der direkten deutschen Übersetzung als „(Deklaratives)Wissen” zu sehen, sondern vor allem auch als prozedurales Wissen. So spricht Shulman (1987b) auch von “Skills” und über „what teachers should know and know how to do“ (Shulman, 1987b, S. 19). Damit wird deutlich, dass auch schon Shulman davon ausging, dass Wissen auch angewendet werden muss und demnach im Sinne einer Kompetenz zu verstehen ist. An anderer Stelle spricht er im Zusammenhang mit der Fundierung seiner Forschung ausdrücklich von „teaching competence“ (Shulman, 1986a, S. 4). Auch Baumert und Kunter sprechen zwar von Professionswissen, ordnen dieses aber in ihr Modell der professionellen Handlungs kompetenz ein.
Theoretische Grundlagen 15 2.3 Forschungsstand des Professionswissens von Lehrkräften Der Thematisierung naturwissenschaftlicher Erkenntnismethoden im Unterricht wird bislang nicht ausreichend Raum eingeräumt. Als Grund dafür wurden in den letzten Jahren eine unzureichende explizite Thematisierung in der Ausbildung von Lehrerinnen und Lehrern und eine daraus resultierende geringe Vertrautheit mit dem Thema diskutiert (Kircher & Dittmer, 2004, S. 4). Auch Leisner-Bodenthin (2006, S. 107) berichtet davon, dass die Lehrkräfte in ihren Fortbildungen zunächst von der Notwendigkeit eines derartigen Unterrichts6 überzeugt werden mussten. 2.3.1 Der Einfluss von Subject Matter (Content) Knowledge Subject Matter (Content) Knowledge umfasst, wie oben dargestellt, sowohl die fachlichen Inhalte einer Disziplin (CK) als auch die Prozesse, mit denen neues Wissen generiert wird (SK) (Grossman et al., 1989). Einige der im Folgenden zitierten Studien fokussieren explizit das SMK. Andere Studien verwenden den Terminus Fachwissen in Bezug auf CK, womit aber nicht zwangsläufig SK ausgeschlossen wird7. Es wird immer gekennzeichnet, welches Konzept in der jeweiligen Studie fokussiert wurde. Der Zusammenhang zwischen dem Lernerfolg von Schülerinnen und Schülern und dem Inhaltlichen Fachwissen (SMK) wurde in verschiedenen Studien thematisiert. In Ihrem Beitrag zum Subject Matter (Content) Knowledge kommen Grossman et al. (1989, S. 25) zu dem Ergebnis, dass es keinen einfachen Zusammenhang zwischen beiden Punkten gibt. Auch Lipowsky (2006, S. 52) konnte in seinem Überblicksartikel Indizien für einen Zusammenhang nur für die Mathematik finden. Für die Naturwissenschaften konnte er in den von ihm einbezogenen Studien keine eindeutige Befundlage ermitteln. In ihrem großen Überblicksartikel über das Lehrerprofessionswissen findet Abell (2007, S. 1120) Hinweise für einen positiven Zusammenhang, auch wenn sie selber auf die Unterschiedlichkeit der Studien hinweist. Sie vermutet einen über andere Variablen moderierten Zusammenhang. In der neueren Version des Überblicksartikels kommen van Driel et al. (2014, S. 861) zu dem Schluss, dass Fachwissen (SMK) eine notwendige aber nicht hinreichende Voraussetzung von PCK ist. Bezüglich des Fachdidaktischen Wissens von Physiklehramtsstudierenden kommen Riese und Reinhold (2012, S. 135) zu einem ähnlichen Ergebnis: Hohes Fachdidaktisches Wissen erfordert ein hohes Fachwissen. Abell (2007, S. 1119) findet in den von ihr durchgesehen Studien deutliche Hinweise auf einen Einfluss 6 In diesem Fall zu Modellen. 7 Die Begriffe werden vielmehr synonym verwendet (s. o.).
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 16 eines ausgeprägten Fachwissens (SMK) auf die Unterrichtsqualität. Auch in aktuelleren Studien zeigt sich, dass profundes Fachwissen: „is typically associated with more confidence and more interactive and adventurous ways of teaching.“ (van Driel et al., 2014, S. 854). Cauet et al. (2015) untersuchen in ihrer Studie den Einfluss des Professionswissens von Gymnasiallehrkräften auf den Lernzuwachs ihrer Schülerinnen und Schüler. Auch sie kommen zu dem Ergebnis, dass sich ein Einfluss von CK auf einen kognitiv aktivierenden Unterricht zumindest andeutet. Ein Einfluss auf den Leistungszuwachs der Lernenden konnte nicht festgestellt werden. Auch Vogelsang (2014) kommt in seiner Analyse des Paderborner Instruments (Riese, 2009) zu dem Ergebnis, dass „kein direkter Zusammenhang zwischen dem erfassten Professionswissen und der Performanz im Physikunterricht besteht“ (Vogelsang, 2014, S. 502). Professionswissen kann demnach nicht unmittelbar in Handeln umgesetzt werden. Vielmehr bedürfe es zum Unterrichten mit hoher Performanz einer zusätzlichen Ressource, die möglicherweise im Sinne einer ‚Erfahrung‘ im Vorbereitungsdienst erworben werde. Bezüglich der konkreten Entwicklung des CK deutet sich an, dass sich dieses erwartungsgemäß im Verlauf des Lehramtsstudiums kontinuierlich entwickelt. Innerhalb des ersten Studienjahres erfolgt der größte Kompetenzzuwachs. Im letzten Studienjahr erfolgt ein Abfall der gemessenen Kompetenzen, was die Autoren der Studie unter anderem durch träges Wissen und Vergessenheitseffekte erklären (Kröger, Neumann & Petersen, 2015, S. 108). Schulrelevantes Fachwissen ist bei im Dienst befindlichen Physiklehrkräften höher als bei Studierenden oder Referendaren. Es verändert sich aber über die Dienstjahre kaum. Dieses Wissen wird demnach vermutlich direkt am Anfang des Lehrerberufs ausgebildet (Borowski, Kirschner, Liedtke & Fischer, 2011). Kirschner (2013, S. 83ff.) findet in ihrer Studie, die das Professionswissen von Physiklehrkräften in der Ausbildung und im Schuldienst untersucht, eine doppelt so große Korrelation von CK und PCK im Vergleich von PK zu CK (r=.453 zu r=.265). Sie stellt außerdem eine Korrelation mit dem Geschlecht fest: Sowohl in CK, als auch in PCK schneiden männliche Lehrkräfte besser ab. 2.3.2 Syntactic Knowledge (SK) Während die vorher genannten Studien sich auf Fachwissen (SMK) im Allgemeinen beziehen, so wurde auch das Syntactic Knowlegde (SK) näher untersucht8. Emereole (2009) kommt in seiner Studie zu dem Ergebnis, dass die untersuchten Lehrkräfte nicht ausreichend mit dem Thema der Erkenntnisprozesse in den Naturwissen8 Einige der hier genannten Studien wurden auch in Abell (2007) zitiert.
Theoretische Grundlagen 17 schaften vertraut sind, um die Lerner bei der Entwicklung eines angemessenen Verständnisses der Erkenntnisprozesse zu unterstützen. Auch schienen die untersuchten Lehrkräfte nicht in der Lage zu sein, ihren eigenen Wissenstand in Bezug auf Erkenntnisprozesse angemessen einzuschätzen (Emereole, 2009). In einer qualitativen Studie (Windschitl, 2003, S. 138) mit sechs Lehramtsstudierenden zeigten die Proband/inn/en Probleme bei der Aufstellung von passenden Fragestellungen. Die Generalisierbarkeit scheint aber aufgrund der geringen Stichprobe nicht gegeben. Bei der Untersuchung von Biologie-Lehrkräften kommt Yip (2001) zu dem Ergebnis, dass die meisten Proband/inn/en die Rolle von Hypothesen („Concepts of Assumptions“) im Erkenntnisprozess nur mangelhaft verstehen würden. Auch zur Beurteilung der Evidenz eines Ergebnisses in Bezug auf ihre Annahmen seien diese nicht fähig. Lawson (2002) kommt in seiner Studie zu dem Ergebnis, dass Lehramtsstudierende der Biologie Probleme im Testen von Hypothesen haben, die nicht direkt zugängliche (beobachtbare) Variablen beinhalten. Taylor und Dana (2003) untersuchten in einer Fallstudie drei Physiklehrkräfte mit verschiedener Berufserfahrung bezüglich ihrer Fähigkeiten, unkontrollierte Variablen in Experimenten zu identifizieren und selber kontrollierte Experimente zu planen. Sie kommen zu dem Ergebnis, dass eine festgestellte ausgeprägte Fähigkeit im Erkennen unkontrollierter Experimente nicht automatisch auch dazu führt, selbständig richtig kontrollierte Experimente planen zu können. So wurden in der Planung der Experimente bestimmte Variablen ignoriert und nicht weiter kontrolliert. Sie schlussfolgern, dass es zwei KompetenzEbenen bei der Kontrolle von Experimenten gibt. So erfordere die niedrigere Ebene, das Erkennen von unkontrollierten Experimenten, geringere Fähigkeiten als die höhere Ebene, das Planen eigener kontrollierter Experimente. Roth, McGinn und Bowen (1998) untersuchen in ihrer Studie die Aufbereitung von Daten in Form von Repräsentationen (Graphen, u.ä.). Sie stellen fest, dass sich die Nutzung von Repräsentationen durch Lehramtsstudierende auf demselben Niveau wie von 8Klässlern bewegt. Die durch andere befragte Forschende genutzten Strategien wurden nicht eingesetzt. In einer deutschlandweit durchgeführten Studie mit Physiklehramtsstudierenden (Woitkowski, 2015; Woitkowski et al., 2014) konnten das Geschlecht, die Abiturnote und Praktikumszeit als signifikante Einflussfaktoren auf den Kompetenzstand im Bereich Er-
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 18 kenntnisgewinnung identifiziert werden9. Außerdem wurden keine signifikanten Studiengangseffekte festgestellt. Der Kompetenzstand im Bereich der Erkenntnisgewinnung wird demnach nicht von der Studienart (Lehramt, Fachphysik) beeinflusst (Woitkowski, 2015). Leisner-Bodenthin (2006) stellte in ihrer Studie zur Förderung von Modellkompetenz im Schulunterricht fest, dass bei den Lehrkräften ein Missverständnis auftrat, bezüglich eines Lernen über Modelle. Die Lehrerinnen und Lehrer gingen vielmehr von einem Lernen mit Modellen aus. Als Ergebnis der Studie folgert sie, dass „Für die Entwicklung domänenspezifischer Modellkompetenz […] die Kompetenz der Lehrkraft (Fachwissen, Wissenschaftsverständnis, […], Modellbildung, […]) ausschlaggebend“ seien. (Leisner-Bodenthin, 2006, S. 106). In einer Studie mit Niederländischen Naturwissenschaftslehrenden zeigte sich, dass diese im Zweck von Modellen hauptsächlich eine Repräsentationsund Erklärungsfunktion sahen. Nur wenige Lehrende gaben an, dass Modelle auch zum Aufstellen von Voraussagen genutzt werden können (Van Driel, Jan H. & Verloop, 1999, S. 1150). Auch Justi und Gilbert (2003) bescheinigen dem Großteil der von ihnen untersuchten Lehrkräften eine naive Vorstellung von Modellen. Die meisten der Proband/inn/en sahen in Modellen ein Abbild von etwas und ein Idealbild an dem man sich orientieren muss. Nahezu 90% der Proband/inn/en gaben außerdem an, dass Modelle zur Visualisierung oder Erklärung dienen. Dennoch gaben auch 82% der Proband/inn/en an, dass Modelle genutzt werden können, um Voraussagen zu tätigen. Bei einer detaillierteren Analyse nach Fächern zeigte sich, dass gerade Physikund Chemielehrkräfte ein Bild von Modellen hatten, was einem wissenschaftlichen Bild am nächsten kam. Sämtlichen der untersuchten Physiklehrkräfte war außerdem bewusst, dass Modelle zum Tätigen von Voraussagen genutzt werden können (Justi & Gilbert, 2003). Oh und Oh (2011) fassen die Ergebnisse folgendermaßen zusammen: „teachers’ perceptions of models were complex and sometimes inconsistent and [.] they adopted different approaches to using models in their instructions, depending on their knowledge, beliefs and experiences“ (Oh & Oh, 2011, S. 1110) 9 Die Abiturnote verlor ihre Signifikanz, sobald die Mathematiknote aus der Schule, sowie das Absolvieren einer Abiturprüfung in Physik mit einbezogen wurden. Stattdessen wurden diese beiden Punkte signifikant.
Theoretische Grundlagen 19 2.3.3 Einfluss von SK auf den Unterricht Der Zusammenhang mit dem Lernerfolg und der Gestaltung von Unterricht zeigt sich in verschiedenen Studien. So konnte gezeigt werden, dass die Fähigkeit der Lehrkraft in der Variablenkontrolle und das Verständnis der Erkenntnisprozesse positiv mit den gemessenen Leistungen der Lernenden verknüpft sind. Dabei kam der Fähigkeit zur Variablenkontrolle der größte Einfluss zu (Aiello-Nicosia, Sperandeo-Mineo & Valenza, 1984). Auch ein Einfluss auf die Gestaltung von Unterricht wird diskutiert und in Studien genauer untersucht: „Teachers who do not understand the role played by inquiry in their disciplines are not capable of adequately […] teaching that subject matter to their students“ (Grossman et al., 1989, S. 30). Ähnlich argumentieren auch Taylor und Dana (2003, S. 723): „[…] it is likely that science teachers must first possess appropriate conceptions of scientific evidence themselves before they can help their students develop similar conceptions.” Empirisch zeigten sich einige dieser vermuteten Zusammenhänge. So führt Yip (2001) eine unkritische Haltung von Schülerinnen und Schülern gegenüber den Ergebnissen von Experimenten auf ein mangelhaftes Verständnis der Erkenntnisprozesse (s.o.) durch die Lehrenden zurück. Folge auf der einen und Ursache auf der anderen Seite seien ein fast ausschließlicher Einsatz von stark gelenkten Experimenten im Unterricht („Kochrezeptexperimente“). Windschitl (2003, S. 138f.) konnte in einer Fallstudie mit sechs Lehramtsstudierenden den Einfluss von Erfahrungen mit authentischen Forschungsprojekten während ihrer Ausbildungsphase zeigen. Diese Studierenden setzten eher offene Formen von Inquiry based science Learning (IBSL) in ihrem eigenen Praktikumsunterricht ein. Auch wenn diese Ergebnisse auf Grund der kleinen Stichprobe und anderer Limitationen der Studie nur bedingt aussagekräftig sind, so decken sich diese Ergebnisse mit anderen Studien. So zeigt sich dort, dass Lehrende, die im Rahmen von Fortbildungen selbstständig Forschungsvorhaben durchgeführt haben, eine erhöhte Selbstwirksamkeit in Bezug auf das Durchführen von IBSL basiertem Unterricht aufwiesen (Morrison, 2014). Windschitl (2003) kommt zu dem Schluss, dass „of all the factors examined, preservice teachers’ use of inquiry in the classroom is most strongly associated with previous research experience. Knowing then how potentially powerful these experiences can be, it suggests that teacher education programs should promote some authentic science research experiences either in conjunction with methods classes or within other areas of the preservice program.” (Windschitl, 2003, S. 140).
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 26 angegriffen wird, über die Regeln diskutiert (Kuhn, 1976b, S. 62). Dieses Angreifen eines Paradigmas – Kuhn nennt es Krise – beginnt mit der Entdeckung einer Anomalie, also „mit der Erkenntnis, dass die Natur in irgendeiner Weise die von einem Paradigma erzeugten, die normale Wissenschaft beherrschenden Erwartungen nicht erfüllt hat.“ (Kuhn, 1976b, S. 66). Gleichzeitig muss diese Anomalie empirisch und theoretisch anerkannt werden, ihr Anomaliecharakter muss also von der Wissenschaftsgemeinde akzeptiert werden. Daraufhin verändern sich die Paradigmakategorien und –verfahren (Kuhn, 1976b, S. 75). Neben solchen Anomalien kommen auch das Auftauchen neuer Theorien, die die Natur umfassender erklären können, oder theoretische Konflikte in Frage. Letztere werden sichtbar, wenn es zu „Wucherungen von Versionen einer Theorie“ kommt, die Forschenden also mit allen Mitteln versuchen, das bislang vorherrschende Paradigma mit wenigen Korrekturen auf die Natur anzupassen (Kuhn, 1976b, S. 81–83). In Folge der Krise kommt es zur wissenschaftlichen Revolution. Damit werden „jene nicht kumulativen Entwicklungsepisoden angesehen [.], in denen ein älteres Paradigma ganz oder teilweise durch ein nicht mit ihm vereinbares Neues ersetzt wird“ (Kuhn, 1976b, S. 104). Revolutionen müssen aber nicht die komplette Wissenschaft betreffen, selbst wenn sie demselben Paradigma folgen (Kuhn, 1976b, S. 64). Die Frage, welches von zwei konkurrierenden Paradigmen gewählt werden sollte, lässt sich laut Kuhn nicht mit den Kriterien der normalen Wissenschaft lösen, weil beide Paradigmen unter dem Gesichtspunkt ihrer selbst gestellten Werte und Normen diskutiert werden. Dadurch werden die Diskussionen grundsätzlich aneinander vorbei geführt. Da ein Paradigma nicht alle Probleme lösen kann und zwei konkurrierende Paradigmen unterschiedliche Probleme lösen, ist die Frage nach der Bedeutung der gelösten Probleme entscheidend (Kuhn, 1976b, S. 122). Ein vorherrschendes Paradigma wird aber erst abgelöst, wenn ein neues seinen Platz einnehmen kann (Kuhn, 1976b, S. 90). An dieser Stelle betont Kuhn auch seine Ablehnung der Falsifikation. Durch einen Vergleich der Theorie mit der Natur wird eine Theorie nicht falsifiziert. Erst wenn ein anderes Paradigma existiert, das diesen Platz einnehmen kann, kommt es zu einem Paradigmenwechsel. „[…] das Urteil das zu dieser Entscheidung führt, beinhaltet den Vergleich beider Paradigmata mit der Natur und untereinander.“ (Kuhn, 1976b, S. 90). Das Ziel der Wissenschaft ist „Theorie und Tatsachen in bessere Übereinstimmung zu bringen, und diese Tätigkeit kann leicht als ein Prüfen oder als ein Suchen nach Bestätigung oder Falsifika-
Theoretische Grundlagen 27 tion angesehen werden. Hingegen ist ihr Ziel die Lösung eines Rätsels, für dessen bloße Existenz die Gültigkeit des Paradigmas vorausgesetzt werden muss.“ (Kuhn, 1976b, S. 91). Das Scheitern bei der Lösung eines Rätsels führt demnach nicht zur Falsifikation. Vielmehr wird dies als Anomalie oder als Scheitern des Forschenden angesehen (Chalmers, 2007, S. 92). „Die normale Forschung ist nicht kritisch, sondern traditionsund paradigmagesteuert. Sie unternimmt keine Versuche, eine grundlegende und paradigmatische Theorie zu falsifizieren; […] Die „normale Forschung“ versucht nicht, etwas zu entdecken, weder neue Phänomene noch neue Theorien.“ (Andersson, 1988, S. 44). Ein Kritikpunkt, der Kuhn’s Ansichten betrifft, ist der Übergang zwischen zwei Paradigmen. Hierbei wird kritisiert, dass es keine Kriterien gibt, woran festgemacht werden könnte, welches Paradigma vorzuziehen ist. Dies begründet sich zum einen darin, dass es viele verschiedene Faktoren gibt, nach denen eine solche Entscheidung gefällt werden müsste, und zum anderen darin, dass in den verschiedenen Paradigmen unterschiedliche Standards existieren, die dabei herangezogen werden. Die Vertreter der jeweiligen Paradigmen erkennen aber die Standards des jeweils anderen nicht an (Chalmers, 2007, S. 96–97, 101). 2.5.4 Lakatos Forschungsprogramme Lakatos (1974) versucht, mit seinem Ansatz die wissenschaftsgeschichtliche Analyse Kuhns mit der Logik der Forschung Poppers zu begegnen (Andersson, 1988, S. 5). Als Hauptunterschied zwischen den Theorien von Popper und Kuhn identifiziert Lakatos (1974, S. 91), dass für „Popper Wissenschaft ‘Revolution in Permanenz‘ und Kritik der Kern des wissenschaftlichen Unternehmens ist“, während Kuhn eine Revolution als Ausnahme darstellt und Kritik kein Thema sei. Als weiteren Unterschied identifiziert Lakatos (1974, S. 91), dass der Wandel in den Wissenschaften bei Popper rational zu erklären ist, während bei Kuhn der Wechsel zwischen zwei Paradigmen keinen Vernunftregeln folgt. Damit würde die Frage der Annahme eines Paradigmas zu einer Machtfrage, statt dass sie rational zu erklären ist. Lakatos unterscheidet in seiner Analyse den dogmatischen, den methodologischen, den naiven und den raffinierten Falsifikationismus. Der dogmatische Falsifikationismus geht davon aus, dass alle Theorien nur Vermutungen sind, die nicht bewiesen, jedoch widerlegt werden können. Die Kriterien, die eintreten können, nach denen eine Theorie als falsifi-
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 28 ziert gelten muss, müssen im Vorhinein angegeben werden (Lakatos, 1974, S. 94). Lakatos hält diese Form des Falsifikationismus für unhaltbar, unter anderem deswegen, weil sämtliche Theorien beobachtbare Sachverhalte nicht verbieten. Daher kann eine Theorie durch Hilfshypothesen immer weiter gestützt werden (Lakatos, 1974, S. 98-99). Im methodologischen Falsifikationismus (zu dem Lakatos auch Popper zählt) wird berücksichtigt, dass die experimentellen Aufbauten, mit denen Theorien geprüft werden sollen, ihrerseits auf fehlbaren Theorien beruhen (Lakatos, 1974, S. 104). Eine Theorie darf aber nicht auf Grundlage eines einzelnen Experiments fallen gelassen werden. Vielmehr muss die Falsifikation auf Grundlage mehrerer Wiederholungen basieren und die Nebenannahmen der Falsifikation müssen sich ihrerseits selber bewährt haben (Lakatos, 1974, S. 105). Problematisch ist hierbei, dass die Möglichkeit besteht, dass eine wahre Theorie verworfen wird und eine falsche angenommen, z.B. weil die Nebenannahmen falsch waren oder die Messung auf Irrtümern beruhte (Lakatos, 1974, S. 106). Jedoch kommt nur durch den Mut, diese Entscheidungen zu fällen (auch mit dem Risiko die richtige Theorie verworfen zu haben), wissenschaftlicher Fortschritt zustande (Lakatos, 1974, S. 110). Eine Weiterentwicklung des Falsifikationismus nennt Lakatos (1974, S. 113) den raffinierten Falsifikationismus („sophisticated falsificationism“). Die wesentliche Erweiterung ist, dass es für eine wissenschaftliche Theorie nicht mehr ausreicht, dass sie falsifizierbar ist. Sie muss gleichzeitig auch mehr erklären als ihre vorangegangene Theorie. Einerseits bezieht sich dies auf bereits bekanntes, also der Frage, ob die neue Theorie Umstände eher erklären kann als ihr Vorgänger. Andererseits können in der folgenden empirischen Überprüfung weitere Voraussagen der Theorie überprüft werden. Daraus folgt, dass die konkurrierende Theorie mehr Falsifikationsmöglichkeiten bieten muss, als ihre Vorgängerin. Da es für sämtliche Hypothesen natürlich unendliche Falsifikationsmöglichkeiten gibt, ist dieser Punkt damit zu übersetzen, ob die Hypothese umfassendere Aussagen über die Wirklichkeit macht als eine konkurrierende Vorgängerhypothese. Diese Einschränkung vermeidet ad-hoc Modifikationen, um Hypothesen zu retten, z. B. X hängt von Z ab, außer wenn Y eintritt (Chalmers, 2007, S. 63–64). In dieser Spielart des Falsifikationismus gilt eine Theorie nur dann als falsifiziert, wenn neben der Falsifikation der etablierten Theorie zusätzlich eine neue Theorie existiert, die in der Lage ist, neuartige Tatsachen zu erklären, gleichzeitig aber die bewährten Tatsachen aus der alten Theorie weiterhin erklärt (Lakatos, 1974, S. 114).
Theoretische Grundlagen 29 Lakatos (1974, S. 129) merkt an, dass es sich bei den häufig als Theorie bezeichneten Annahmen (z.B: der Newton‘schen Mechanik) nicht um eine einzelne Theorie, sondern vielmehr eine Theorienreihe handeln würde. Diese Reihe verbindet eine gewisse Kontinuität. Diese Kontinuität bezeichnet er als Forschungsprogramm und weist selber auf die Ähnlichkeit zur Kuhn’schen Normalwissenschaft hin. Seiner Ansicht nach ist es ein Zeichen reifer Wissenschaft, das Forschen nach Versuch und Irrtum überwunden zu haben und stattdessen in Forschungsprogrammen zu arbeiten (Lakatos, 1974, S. 169). Wichtigster Teil eines Forschungsprogramms ist ein harter Kern von allgemeinen Hypothesen, die die Basis für weitere Forschung innerhalb des Programms bieten (Chalmers, 2007, S. 108). Dazu entstehen Regeln, die den Kern vor Angriffen schützen sollen. Diese geben vor, welche wissenschaftlichen Wege man beschreiten (positive Heuristik) und welche man unbeschritten lassen sollte (negative Heurisitk). Heuristik ist bei Lakatos als „Menge von Regeln oder Hinweisen zur Unterstützung von Entdeckungen bzw. Erfindungen“ (Chalmers, 2007, S. 109) zu verstehen. Im Rahmen der negativen Heuristik entstehen Hilfshypothesen, die die Theorie vor widerlegenden Experimenten schützen sollen (Lakatos, 1974, S. 131). Die positive Heuristik gibt Forschungsstrategien oder Forschungsordnungen vor, die Ansätze dafür liefern, wie die Theorie weiter entwickelt werden kann. Sie „besteht aus einer partiell artikulierten Reihe von Vorschlägen oder Hinweisen, wie man die ‚widerlegbaren Fassungen‘ des Forschungsprogramms verändern und entwickeln soll und wie der ‚widerlegbare‘ Schutzgürtel [um den Kern der Theorie, Anm. des Verfassers], modifiziert und raffinierter gestaltet werden kann.“ (Lakatos, 1974, S. 131). Solche Heuristiken können ganz bewusst eingesetzt werden, um neue Theorien zu etablieren, die anderen bewährten Theorien widersprechen, so zum Beispiel Bohr’s Atomtheorie, die die Voraussagen Maxwells über das Abstrahlen von Energie per Definition außer Kraft setzte (Lakatos, 1974, S. 137 ff.). „Die Arbeit innerhalb eines einzelnen Programms beinhaltet [also] die Erweiterung und Modifikation des Schutzgürtels durch die Hinzunahme und Benennung verschiedener Hypothesen“ (Chalmers, 2007, S. 111). Die Bedingung für derartige Hypothesen ist aber, dass diese tatsächlich überprüfbar sind (Chalmers, 2007, S. 111)! Auch in den Forschungsprogrammen kann es aber zu einem Punkt kommen, an denen die Anomalien überhand nehmen, genau wie die zu deren Lösung aufgestellten AdhocHypothesen. Es setzt die Phase der Degeneration12 eines Programms ein, welche durch 12 Auch hier benennt Lakatos die Äquivalenz zu den Kuhn’schen Krisen eines Paradigmas
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 30 das Auftauchen einer neuen Theorie, die mehr erklärt als die alte, noch beschleunigt werden kann (Lakatos, 1974, S. 149). Lakatos (1974, S. 150) betont aber, dass neue Forschungsprogramme nicht erst dann auftreten (und auftreten sollten) wenn die degenerative Phase eines Programms eingesetzt hat. Vielmehr ist wichtig, dass es einen Wettstreit zwischen konkurrierenden Programmen gibt. „[…] die Kontinuität der Wissenschaft, die Zähigkeit gewisser Theorien, die Rationalität eines gewissen Ausmaßes an Dogmatismus, [lässt] sich nur dann erklären [.], wenn wir die Wissenschaft als ein Schlachtfeld von Forschungsprogrammen und nicht von isolierten Theorien auffassen.“ (Lakatos, 1974, S. 168). Hierbei grenzt er sich von Kuhn ab, bei dem ein Paradigma (oder Forschungsprogramm) eine Monopolstellung beanspruche. Dies entspreche weder der Historie noch sei es wünschenswert. Der Wettstreit zwischen konkurrierenden Forschungsprogrammen kann durch Experimente entschieden werden, wenn die Forschungsprogramme unterschiedliche Vorrausagen machen. Eine Niederlage eines Programms führt allerdings noch nicht zur Aufgabe des Programms in Gänze. Erst wenn auch in folgenden Versuchen das Programm weiterhin unterliegt, muss es aufgegeben werden (Lakatos, 1974, S. 150). Die Aufgabe eines Programms erfolgt also nicht auf Grundlage eines entscheidenden Experiments (experimentum crucis), sondern dieses Experiment wird erst rückblickend zu diesem ernannt (Lakatos, 1974, S. 157, 167). Auch Lakatos Position wird kritisiert. So liefere die Theorie keinen Ansatz für die Bewertung aktueller Forschungsprogramme. Es bleibe weiterhin nützlich, auch an degenerierenden Forschungsprogrammen festzuhalten, da diese ein Comeback erleben könnten. Erst in der Rückschau sei es möglich, die Wissenschaftsgeschichte im Sinne Lakatos zu interpretieren. Ein weiterer Punkt, der kritisiert wird, ist, dass nicht bei allen Forschungsprogrammen tatsächlich ein harter Kern zu identifizieren sei. Vielmehr würde es Programme geben, in denen Forschende zur Lösung von Problemen so weit gingen, dass harte Kerne nicht mehr auszumachen seien (Chalmers, 2007, S. 118 ff.). 2.5.5 Zusammenfassung Mit Popper, Kuhn und Lakatos wurden die Ansätze von dreien der vier einflussreichsten Wissenschaftstheoretiker des 20. Jahrhunderts vorgestellt. Wie dargestellt wurde, haben alle drei Ansätze auch Kritik erfahren. Teilweise wird aber der Ansatz von Lakatos, der sowohl in der Tradition Poppers steht, aber auch Elemente von Kuhn enthält, als der am weitesten fortgeschrittene bezeichnet (z.B. Worral, 1980). Der bislang unerwähnte vierte
Theoretische Grundlagen 31 Wissenschaftstheoretiker ist Paul Feyerabend, der mit seinem Buch „Wider den Methodenzwang“ (1983), die Ansicht vertrat, dass „Wissenschaft keinerlei Merkmale aufweise, die sie notwendiger Weise anderen Erkenntnisformen überlegen mache.“ (Chalmers, 2007, S. 122) und damit sämtliche Ansätze von Popper, Kuhn und Lakatos als falsch beurteilt. Das einzige Prinzip, dass der Wissenschaft zu Grunde liegen könnte, sei der Ansatz, dass alles gehen würde ('anything goes', Feyerabend, 1983, S. 32). Feyerabend kommt zu dem Schluss, dass sämtliche Versuche, die Wissenschaft von anderen Erkenntnisformen abzugrenzen, gescheitert seien. Er sieht gar die Gefahr der Repression der Menschheit durch die Wissenschaft (Chalmers, 2007, S. 126). Die dargestellte Kritik wird von heutigen Wissenschaftsphilosophen teilweise bejaht, jedoch nur soweit, dass es unrealistisch erscheint, dass es eine universelle Methode von Wissenschaft gibt. So vertritt Chalmers (2007, S. 132) die Ansicht, dass es zwar keine universelle Methode gebe, sehr wohl aber „historisch kontingente Methoden und Standards“ die erfolgreiche Wissenschaftsdisziplinen enthalten (Chalmers, 2007, S. 132). Die historische Entwicklung wissenschaftlicher Erkenntnis wird eher in den Ansätzen von Lakatos oder Kuhn beschrieben. Während ein Paradigmenwechsel bei Popper lediglich zum Austausch einiger Sätze führt, so berücksichtigt Kuhn auch „eine Änderung der Wahrnehmung von Realität und eine Veränderung der Maßstäbe, die an die Bewertung einer Theorie angelegt werden.“ (Chalmers, 2007, S. 100). Problematisch an Kuhns Theorie sei aber, dass es nach Kuhn keine neutralen Regeln gibt, nach denen entschieden werden kann, ob eine Theorie fortschrittlich ist (Chalmers, 2007, S. 101). Der Wechsel zwischen zwei Paradigmen sei vielmehr eine Sache der Mode und nicht rational zu beschreiben (Lakatos, 1974, S. 172). Lakatos Theorie der Forschungsprogramme vermeidet dieses Problem. Der Wechsel zwischen zwei Forschungsprogrammen lässt sich durch die Überlegenheit eines Programms klar rational begründen (s.o.) (Chalmers, 2007, S. 113). In der Rolle des theoretischen Rahmens liegt ein Hauptunterschied zwischen den drei genannten Ansätzen: Bei Popper als Gebäude, bei Kuhn als Paradigma und bei Lakatos als Forschungsprogramm bezeichnet. Popper selbst scheint mit den Laktos’schen Forschungsprogrammen mehr zu sympathisieren als mit der Normalwissenschaft mit ihrem Paradigma. Forschungsprogramme können auch parallel existieren, während das vorherrschende Paradigma über allen Konkurrenten stehen würde (Popper, 1974, S. 54). Die normalen Forschenden, wie Kuhn sie beschreibt, existieren zwar, sie seien aber „bemitleidenswert“, weil ihnen eine kritische Grundhaltung fehle (Popper, 1974, S. 53). Es wird aber
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 32 auch für die Normalwissenschaft argumentiert, weil „eine Disziplin, in der Grundsätzliches immer wieder hinterfragt wird,[…][,] kaum bemerkenswerte Fortschritte machen [wird], weil Prinzipien nicht lange genug verschont bleiben, um fachwissenschaftliche Arbeit zu leisten“ (Chalmers, 2007, S. 99). 2.5.6 Folgerungen für ein Kompetenzmodell Kuhn (1974a, S. 6) merkt an, dass die „Fachleute“ für die Zeit der Normalwissenschaft ausgebildet werden und nicht für die Zeiten der Krisen oder Degeneration. Die Übersetzung der dargestellten wissenschaftstheoretischen Ansätze in ein Kompetenzmodell kann also auf eine Berücksichtigung von Krisen verzichten. Viele der zukünftigen Wissenschaftlerinnen und Wissenschaftler werden möglicherweise nie den Wechsel eines Forschungsprogrammes oder eines Paradigmas erleben. Damit entfällt auch die unter Wissenschaftsphilosophen immer noch umstrittene Frage danach, wann eine Theorie abgelehnt werden muss. Guten Gewissens kann man den Forschungsprozess auf das reduzieren, was Kuhn als Rätsellösen bezeichnet oder Lakatos als Ausschärfung der Theorie. Der Wechsel von Forschungsprogrammen (oder -paradigmen) findet ohnehin statt. Ein Kompetenzmodell der Erkenntnisgewinnung muss also vor allem auf die alltägliche Arbeit von Forscherinnen und Forschern fokussieren und ihre alltäglichen Arbeitsund Denkweisen berücksichtigen. Innerhalb eines Forschungsprogramms muss diesem Programm gefolgt werden. Hypothesen müssen also im Sinne Lakatos erlaubt sein, oder, um es mit Popper (1984, S. 26) zu sagen: „Einmal aufgestellte und bewährte Hypothesen dürfen nicht ‚ohne Grund‘ fallengelassen werden.“ Die genauere Betrachtung naturwissenschaftlicher Forschung, wie dies an einigen Beispielen bereits oben geschah, offenbart noch einen anderen Aspekt: So entziehen sich in der Physik (aber auch der Chemie und Biologie) viele der untersuchten Phänomene unserer direkten Wahrnehmung. Die erwähnte Korpuskel-Theorie des Lichts oder das Bohr’sche Atommodell sind nur zwei Beispiele, bei denen dies der Fall ist. An die Stelle der direkten Untersuchung an einem Gegenstand kann dann das Denken in Modellen treten. Aus theoretischen Überlegungen und Modellvorstellungen heraus können Vorhersagen über die Natur getroffen werden. Die oben beschriebenen Erkenntnisprozesse können demnach auch auf Modelle angewendet werden. Sie können so zur Bildung von Hypothesen genutzt werden, die anschließend in der Realität getestet werden (vgl. Bleichroth et al., 1999, S. 27).
Theoretische Grundlagen 33 2.6 Scientific Reasoning: Handlungsmodell der Erkenntnisgewinnung Neben wissenschaftstheoretischen Überlegungen wurden auch kognitionswissenschaftliche Handlungsmodelle zum Prozess der Erkenntnisgewinnung entwickelt. Diese zielen stärker auf die mentalen Prozesse bei der Erkenntnisgewinnung ab und geben sehr viel konkretere Ablaufschemen für mögliche Handlungsschritte oder -komponenten beim Erkenntnisprozess an. Der Prozess bzw. das Handeln von Wissenschaftlerinnen oder Wissenschaftlern bei der wissenschaftlichen Erkenntnisgewinnung wird international unter den Begriffen Scientific Thinking (Kuhn, Amsel & O'Loughlin, 1988) oder Scientific Reasoning (Klahr, 2000; Koslowski, 1996) zusammengefasst (Mayer, 2007). Scientific Thinking ist nach D. Kuhn et al. (1988, S. 219) ein Zusammenspiel von Theorie und Evidenz. Kompetente Forschende sind nach ihrer Definition Personen, die bewusst mit einer Theorie arbeiten, anstatt sie nur anzuwenden. Dabei müssen sie in der Lage sein, Theorie und Evidenz zu unterscheiden und separat mit ihnen umzugehen. Der korrekte Umgang mit der Variablenkontrollstrategie ist ein wesentliches Element (Kuhn et al., 1988, S. 15–17). Die von Kuhn mit diesem Ansatz durchgeführten Studien legen nahe, dass die hauptsächliche Kompetenzentwicklung vom Jugendzum Erwachsenenalter stattfindet. Im Erwachsenenalter bleiben die Kompetenzen aber weit unter einem optimalen Level (Kuhn et al., 1988, S. 219 f.). Koslowski (1996, S. 6) baut auf den Studien von Kuhn et al. (1988) auf, merkt aber an, dass wissenschaftliche Erkenntnisgewinnung nicht vom Vorwissen loslösbar ist. Die Entscheidung, ob zwischen zwei korrelierten Variablen tatsächlich ein Wirkmechanismus bestehe, lasse sich nur durch das Wissen über eine entsprechende Theorie entscheiden, die einen Zusammenhang vorraussagt: „[…] the principles of scientific inquiry are used in conjunction with (not independently of) knowledge about the world.“ (Koslowski, 1996, S. 13) Der Erfolg wissenschaftlicher Erkenntnismethoden hängt demnach auch von der Genauigkeit und der Richtigkeit der Theorien ab. Dieser Ansatz des Scientific Reasoning erfordert von den Proband/inn/en, dass ihre wissenschaftliche Bewertung auf theoretisch korrekten Annahmen beruht, aber auch, dass ein methodologisch legitimer Weg gewählt wurde (Koslowski, 1996, S. 15). Der Prozess des Scientific Reasoning ist nach Klahr (2000, S. 14f.) ein Problemlöseprozess, der zwei Problemräume umfasst, den Hypothesenraum und den Experimentalraum
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 34 (SDDS = Scientific discovery as Dual-search, Klahr & Dunbahr, 1988, S. 32ff.). Grob lässt sich der Ablauf in drei Schritte unterteilen: die Suche im Hypothesenraum, die Suche im Experimentierraum und die Analyse von Evidenz: „[…] Science [involves] […] the generation of hypotheses, the formulation and execution of experiments, and the revision of hypotheses on the basis of empirical evidence“ (Klahr, 2000, S. 15). Bei der Hypothesensuche muss eine Hypothese zur Erklärung eines Phänomens gebildet werden. Diese kann entweder auf Grundlage vorhandenen Wissens oder anhand experimenteller oder beobachteter Ergebnisse gebildet werden. Im Experimentierraum muss dann ein Experiment gefunden werden, was die entsprechende Hypothese prüfen kann. Bei der Analyse von Evidenz muss entschieden werden, ob auf Grundlage der erhobenen Daten eine Hypothese verworfen werden muss oder ob sie durch das Experiment gestützt wurde (Klahr, 2000, S. 30–39).13 Im Mittelpunkt des Modells der „concepts of evidence” (Gott & Duggan, 1995) steht auch die Lösung eines Problems. Innerhalb dieses Konzepts liegt der Hauptfokus auf dem Entwurf eines Experiments, der Messung, dem Umgang mit Daten und der anschließenden kritischen Analyse (Evaluation) der erhaltenen Evidenz. Diese Schritte sind aber nicht unbedingt in zeitlicher Reihenfolge zu verstehen. Sie tragen insgesamt aber zur Absicherung erhaltener Evidenz mittels Daten bei (Gott & Duggan, 1995, S. 30). Fischer et al. (2014, S. 39) unterscheiden acht Komponenten von scientific reasoning: 1. Problem identification: hierbei wird die Situation analysiert und das Problem identifiziert. 2. Questioning: Aufbauend auf dem identifizierten Problem wird eine handlungsleitende Fragestellung formuliert. 3. Hypothesis generation: Dieser Schritt umfasst die Formulierung einer möglichen Antwort auf die Fragestellung. Diese muss theoriegeleitet entwickelt werden und wissenschaftlichen Standards entsprechen. 4. Construction and redesign of artefacts: Unter diesen Punkt fällt die kritische Analyse eventueller Prototypen – sowohl Objekte als auch mathematische Systeme. 5. Evidence generation: Hierunter fällt die Überprüfung der Hypothese z.B. durch Experimente, bei denen die abhängige Variable beobachtet, die unabhängige verändert und sämtliche anderen beteiligten Variablen kontrolliert werden. 13 Das vollständige SDDS-Modell umfasst weitere Unterkategorien, die an dieser Stelle nicht weiter thematisiert werden sollen. Es wird bei Klahr (2000, S. 30–39) umfassend dargestellt.
Theoretische Grundlagen 35 6. Evidence evaluation: Hierbei wird entschieden, inwiefern die Evidenz die Hypothese stützt oder widerlegt. 7. Drawing conclusions: Dieser Punkt umfasst die kritische Analyse der erhaltenen Ergebnisse und den Einbezug anderer Experimente, um zu einem Ergebnis zu gelangen. 8. Communicating and scrutinizing: Dieser Punkt umfasst die kritische Diskussion der erhaltenen Ergebnisse mit anderen Forschenden (Fischer et al., 2014, S. 33–35) Insgesamt stellt sich aus kognitionswissenschaftlicher Sicht der Prozess der Erkenntnisgewinnung als “[.] a complex activity that requires the coordination of several higher level cognitive skills, including heuristic search through problem spaces, inductive reasoning, and deductive logic” dar. (Zimmerman, 2000, S. 109). Innerhalb der Erkenntnisgewinnung lassen sich dömänenspezifisches Wissen (starke Methoden) und domänenübergreifende Strategien (schwache Methoden) unterscheiden, die in allen Wissenschaftsdisziplinen anwendbar sind (Klahr & Simon, 2001, S. 78; Zimmerman, 2000, S. 102). Die starken Methoden sind domänenspezifische Methoden und umfassen beispielweise den Umgang mit Instrumenten, die Prozeduren im Forschungsprozess und experimentelle Paradigmen. Die starken Methoden unterscheiden das alltägliche Denken vom wissenschaftlichen Denken. Schwache Methoden des wissenschaftlichen Denkens bestehen sowohl aus universellen Problemlöseprozessen als auch aus reasoning (Klahr, 2000, S. 12f.). Problemlösen besteht darin, einen Weg von einem Anfangszustand in einen Zielzustand zu überführen (Mayer, 2012, S. 181): „[…] the problem-solving process can be characterized as a search for a path that links initial state to goal state.” (Klahr & Simon, 2001, S. 76). “A problem consists of an initial state, a goal state, and a set of operators for transforming the initial state into the goal state by a series of intermediate steps.” (Klahr & Simon, 2001, S. 76). Die Lösung eines Problems besteht im Planen, Durchführen und Überwachen einer Problemlösung (Mayer, 2012, S. 182). Reasoning ist „the form of thinking that involves inference. Inference can be either inductive or deductive […]”. Inference “is the process where one proposition (i.e., knowledge claim) is arrived at and accepted on the basis of other propositions that were originally accepted” (Ricco & Overton, 2012, S. 257). Die Unterscheidung zwischen Reasoning und Problemlösen ist häufig nicht eindeutig, unter anderem deswegen, weil beide Konzepte die Idee des Erreichens eines Ziels beinhalten, für das es keine bekannten Lösungswege gibt (Zimmerman, 2000, S. 107). Neben der Erkenntnisgewinnung, wie sie hier dargestellt wurde, setzt sich in einigen Ansätzen zum Scientific Reasoning auch die Erkenntnis durch, dass „[…] developing scientific
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 42 Bei der Interpretation von den aus dem Experiment erhaltenen Evidenzen muss eine kritische Grundhaltung angenommen werden: „[…] we must never do experiments in order to confirm our ideas but merely to check them.“, (Duhem, 1998, S. 258). Weiterhin ist es problematisch, Experimente nur im Sinne seiner eigenen Theorie zu sehen: “[…] it quite naturally happens that those who belief to much in their own theories do not sufficiently believe in the theories of others” (Duhem, 1998, S. 258f.). Vielmehr muss man sämtliche Beobachtungen zur Kenntnis nehmen, nicht nur solche, die im Sinne der zu prüfenden Theorie stehen. In der Physik spielen oft auch Wahrscheinlichkeitshypothesen eine Rolle (so zum Beispiel bei der Halbwertszeit von radioaktiven Elementen). Hierbei ist eine direkte Falsifikation schwierig festzustellen, da selbst dann, wenn ein als wahrscheinlich vorhergesagtes Ereignis nicht eintrifft, ja auch noch eine Wahrscheinlichkeit bestand, dass das Ereignis nicht eintritt. Es muss daher vorher auf methodologischer Ebene durch die Forschenden festgelegt werden, ab welchem Grad der Unwahrscheinlichkeit ein Ereignis als falsifiziert gilt (Wiltsche, 2013, S. 93). Experimente in der Wissenschaft sind häufig nicht einfach den Sinnen zugänglich. Während die Beobachtung zweier fallender Steine noch relativ einfach mit den Augen möglich ist, entzieht sich heutige Forschung in den meisten Fällen direkter Beobachtung (Chalmers, 2007, S. 28). Die Experimentatoren sind auf Messinstrumente angewiesen, deren Messungen sie dann interpretieren müssen. Hierbei tritt ein weiteres Problem auf. Die erhaltenen Messwerte müssen so weit wie möglich die intendierte Messgröße anzeigen. Dazu müssen sämtliche Störgrößen eliminiert werden. Dies setzt aber voraus, dass dem Experimentator diese auch bekannt sind (Chalmers, 2007, S. 28). Dieses ist einerseits vom Wissen des Experimentators abhängig, andererseits aber natürlich auch vom Stand der Wissenschaft überhaupt. Bestimmte Störgrößen sind während des Experiments möglicherweise noch gar nicht bekannt und können dementsprechend auch nicht berücksichtigt werden. Die Messungen basieren demnach auf Nebenhypothesen, die ihrerseits auch fehlbar sind. Dieser Aspekt des physikalischen Experimentierens ist auch als DuhemQuine-Thesis bekannt: „The physicist can never subject an isolated hypothesis to experimental test, but only a whole group of hypotheses; when the experiment is in disagreement with his predictions, what he learns is that at least one of the hypotheses constituting this group is unacceptable and ought to be modified; but the experiment does not designate which one should be changed“ (Duhem, 1998, S. 263).
Entwicklung eines Kompetenzstrukturmodells wissenschaftlicher Erkenntnisgewinnung 43 Die von Popper proklamierten „crucial experiments“ sind in der Physik demnach unmöglich (Duhem, 1998, S. 264). a) Kompetenzfacette: Fragestellungen Wissenschaftliche Fragestellungen müssen präzise und eindeutig formuliert sein. Uneindeutige Fragestellungen können zu unpräzisen oder mehrdeutigen Antworten führen (Menne, 1980, S. 119). Die Fragestellungen müssen den derzeitigen Stand der Forschung berücksichtigen (vgl. z.B. Kuhn, 1976b; Lakatos, 1974; Popper, 1974). Gleichzeitig dürfen aber auch akzeptierte Sätze in Frage gestellt werden (Menne, 1980, S. 119). b) Kompetenzfacette: Hypothesen „During hypothesis generation, students derive possible answers to the question from plausible models, available theoretical frameworks or empirical evidence they are aware of.” (Fischer et al., 2014, S. 33; siehe auch Klahr & Dunbahr, 1988). Zur Beantwortung einer Fragestellung werden theoriegeleitet Hypothesen aufgestellt, welche den derzeitigen Stand der Forschung berücksichtigen. Um Probleme zu umgehen, die aus verschiedenen Deutungen des Ausganges eines Experiment resultieren können – also der Frage, ob das Experiment die Hypothese nun stützt oder verwirft – ist es notwendig Hypothesen exakt und eindeutig zu formulieren (Chalmers, 2007, S. 58). Eine Hypothese muss so aufgestellt werden, dass sie „an der sinnlichen Erfahrung“ scheitern kann (Wiltsche, 2013, S. 81). Sie muss demnach falsifizierbar sein (Popper, 1984). c) Kompetenzfacette: Planung und Durchführung „A False scientific hypotheses is best refuted by showing that the „facts“ deduced from it are not true; that is by scientific test or experiment“ (Shamos, 1959, S. 8). Eine aufgestellte Hypothese wird durch ein Experiment geprüft. Dabei wird theoriegeleitet der Einfluss einer Variable auf eine andere beobachtet (Fischer et al., 2014). Die zu beobachtende Variable muss entsprechend isoliert werden, d.h. sämtliche anderen Variablen müssen kontrolliert werden (Pietschmann, 1996). Dabei ist es notwendig, dass sämtliche störende Variablen auch bekannt sind (Chalmers, 2007). d) Kompetenzfacette: Auswertung und Interpretation Die Entscheidung über das Verwerfen oder die Akzeptanz einer Hypothese ist ein komplexer Prozess, der, wie dargestellt, auch von vorherrschenden Paradigmen beeinflusst wird und ebenfalls nicht auf Grundlage eines Experiments geschehen kann. Außerdem sind zur Auswertung ein theoretisches Wissen über Wirkungszusammenhänge und Alter-
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 44 nativhypothesen notwendig (Koslowski, 1996, s.o.). Im Fokus des Bereichs Auswertung und Interpretation steht daher die Frage, ob ein durchgeführtes Experiment eine vorliegende Hypothese stützt oder sie ablehnt: „The aim of evidence evaluation is to assess the degree to which a certain piece of evidence supports a claim or theory.” (Fischer et al., 2014, S. 34). 3.4.2 Modelle Nutzen „Modelle sind Annäherungen (an die Wirklichkeit), aber nicht immer wegen einer Ungenauigkeit, sondern weil sie nur bestimmte Aspekte berücksichtigen.“ (Kreisel, 1980, S. 438) Im Sinne des scientific reasoning werden zu Modellen skalierte Nachbildungen, Analogien und (die am häufigsten in der Wissenschaft genutzten) theoretischen Modelle gezählt (Giere et al., 2006, S. 21ff.). Skalierte Modelle sind in der Größe veränderte Nachbildungen. Ein theoretisches Modell “[…]is part of an imagined world. It does not exist anywhere except in scientists‘ mind […]“ (Giere et al., 2006, S. 24). “[…] a model is understood as a representation of a target. The targets represented by models can be various entities, including objects, phenomena, processes, ideas and their systems.” (Oh & Oh, 2011, S. 114). Der in diesem Zitat auftretende Begriff „Target“ (dt. Ziel) betrifft den repräsentierten Gegenstand oder Mechanismus. In der Physikdidaktik umfasst der Begriff „Modell“ nach Stöckler (1995) materielle Nachbildungen und theoretische Modelle. Als weitere Gruppe von Modellen nennt er interpretierte Strukturen, die jedoch nur im Bereich der Mathematik auftauchen. Als materielle Nachbildungen gelten Modelle im Alltagssinn, zum Beispiel verkleinerte oder vergrößerte Abbildungen der Realität. Ein Modellauto oder eine Modelleisenbahn erfüllt – nicht nur durch den Namen – diese Definition. In der Wissenschaft werden verkleinerte Modelle zum Beispiel bei der Konstruktion von Schiffen oder Flugzeugen eingesetzt (Stöckler, 1995). Eine materielle Nachbildung muss aber nicht zwangsläufig eine in der Größe veränderte Abbildung der Realität sein. Vielmehr handelt es sich auch bei Gegenständen um Modelle, die das Verhalten eines anderen anschaulich erklären können. Eine Feder, die auf eine Schnur gespannt und angeregt wird und dabei Longitudinalwellen vorführt ist ein Modell für die Übertragung von Schallwellen in Luft. Ferner zählen als Modelle Nachbildungen von Experimenten, die für den Unterricht didaktisch aufgearbeitet wurden.
Entwicklung eines Kompetenzstrukturmodells wissenschaftlicher Erkenntnisgewinnung 45 Theoretische Modelle sind spezielle Theorien oder Teile einer Theorie. Sie sind „eine idealisierte Beschreibung eines Gegenstandes und seines Verhaltens.“ (Stöckler, 1995). Sie sind demnach Denkgebäude, die ebenso wie ihre realen Pendants bestimmte Eigenschaften der Realität berücksichtigen und andere vernachlässigen. Kircher (1995) schlägt vor, den Modellbegriff ausschließlich auf theoretische Konstrukte anzuwenden. Gegenständliche Nachbildungen von etwas sollten, seiner Ansicht nach als „Realisierung von Modellvorstellungen“ bezeichnet werden. Er räumt aber ein, dass dies weit von der umgangssprachlichen Bedeutung entfernt ist. Stattdessen unterscheidet er fortan „theoretische Modelle“ und „gegenständliche Modelle“ bzw. „Sachmodelle“. Im vorliegenden Forschungsvorhaben werden unter dem Begriff Modelle sowohl materielle Nachbildungen als auch theoretische Modelle verstanden. Dies wird auch unter dem Bewusstsein vorgenommen, dass theoretische Modelle ein sehr viel höheres Abstraktionsvermögen erfordern als materielle Nachbildungen. Dies begründet sich darin, dass bei materiellen Nachbildungen die äußeren Gegebenheiten ohnehin der Realität ähneln (z.B. Flugzeug im Windkanal) oder auf Grund einer Didaktisierung des Experiments viel Wert auf Anschaulichkeit gelegt wird. Bei theoretischen Modellen haben die verwendeten Zeichen und Symbole keinerlei anschaulichen Charakter. Zur Interpretation bedarf es mathematischer Kenntnisse und Vorstellungskraft. Es wird jedoch angenommen, dass die drei Teilkompetenzen, „Zweck von Modellen“, „Testen von Modellen“ und „Ändern von Modellen“, die in diesem Projekt untersucht werden sollen, unabhängig von der Art des Modells sind. Möglicherweise hat die Art des Modells aber einen Einfluss auf die Schwierigkeit der Aufgaben. a) Kompetenzfacette: Zweck von Modellen Naturwissenschaftliche Modelle werden zum Beschreiben, Erklären und Voraussagen von naturwissenschaftlichen Phänomenen genutzt (Oh & Oh, 2011, S. 1116). Einerseits können bekannte Korrelationen und Zusammenhänge im Modell beschrieben werden (Modell von etwas), andererseits können mit Modellen Voraussagen über bislang unbekannte Korrelationen und Zusammenhänge in der Natur getätigt werden (Upmeier zu Belzen & Krüger, 2010, S. 53).
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 46 b) Kompetenzfacette: Testen von Modellen Modelle können getestet werden, indem Sie mit der Natur abgeglichen werden (Oh & Oh, 2011, S. 1119). Dies kann sowohl durch einen nachträglichen Abgleich mit der Natur (Modell von etwas), als auch durch Ableitung von Hypothesen aus dem Modell, die dann in der Natur getestet werden (Modell für etwas), geschehen. Letztere Perspektive ist die Expertensicht auf Modelle (Upmeier zu Belzen & Krüger, 2010, S. 52f.). c) Kompetenzfacette: Ändern von Modellen Im Falle einer mangelhaften Passung der aus der Natur gewonnenen Daten mit dem Modell oder eines Widerspruchs zwischen den aus der Natur gewonnenen Daten und den durch das Modell vorausgesagten Daten, muss das Modell geändert werden (Oh & Oh, 2011, S. 1119). Auch hier besteht die Expertenperspektive darin, Modelle zu verwerfen, weil aus ihnen abgeleitete Hypothesen falsifiziert wurden (Upmeier zu Belzen & Krüger, 2010, S. 53).
Forschungsfragen und Hypothesen 47 4. Forschungsfragen und Hypothesen Das in Kapitel 3 beschriebene Kompetenzstrukturmodell zur naturwissenschaftlichen Erkenntnisgewinnung zeichnet sich durch eine heterogene Struktur mit den beiden Dimensionen naturwissenschaftlicher Arbeitsweisen Untersuchungen und Modelle nutzen aus, mit jeweils dreibzw. vier Kompetenzfacetten (s. Abschnitt 3.3). Die zentrale Idee bei der Entwicklung des Modells war der Ansatz einer domänenübergreifenden naturwissenschaftlichen Erkenntnisgewinnungskompetenz (Fokussierung auf die schwachen, fächerübergreifenden und fachwissensunabhängigen Arbeitsweisen der naturwissenschaftlichen Erkenntnisgewinnung; s. Kap. 3). Bei der empirischen Überprüfung der Gültigkeit dieser Annahme kommt als potentielles und ggf. weiteres Unterscheidungsmerkmal dennoch eine Differenzierung in die drei naturwissenschaftlichen Domänen bzw. Fächer Physik, Biologie und Chemie hinzu. Es gibt also aus theoretischer Sicht zumindest zwei Merkmale, die eine mehrdimensionale Struktur des Modells wahrscheinlich machen. Zur Erfassung der hier modellierten naturwissenschaftlichen Erkenntnisgewinnungskompetenz wurde im Rahmen der Arbeit auch ein Testinstrument bzw. Kompetenztest mit entwickelt, und die Analyse der damit erhobenen Daten können später Aufschluss über die Dimensionalität des Modells liefern. Ein weiteres und zentrales Ziel dieser Arbeit besteht darin zu untersuchen, inwiefern sich Lehramtsund Fachstudierende im Kompetenzstand unterscheiden und wie der Kompetenzstand zu verschiedenen Phasen des Studiums differiert. Im Weiteren wird auch der Kompetenzstand von Grundschullehramtsstudierenden mit dem Studienfach „Integrierte Naturwissenschaften“ näher untersucht. Für diese Arbeit sind daher insgesamt die folgenden Forschungsfragen leitend.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 48 4.1 Frage zur Dimensionierung des Kompetenzstrukturmodells FF1: Welches Modell beschreibt die Daten am besten? Erste Analysen der Gesamtstichprobe (Hartmann, Mathesius et al., 2015) oder von Teilstichproben (Stiller, Straube, Hartmann, Nordmeier & Tiemann, 2015), kamen zu dem Ergebnis, dass ein eindimensionales Modell die bei der Kompetenzmessung erhobenen Daten am besten beschreibt. Für die Passung von Modellen, die nach Arbeitsweisen oder Fächern differenzieren, gab es geringere Evidenz. Es stellt sich daher die Frage, ob dieses Ergebnis auch für die Teilstichprobe der Physikstudierenden gilt. H1a: Ein eindimensionales Modell beschreibt die Daten besser als ein Modell, das nach Fächern differenziert. Der entwickelte Kompetenztest soll auf die schwachen, fächerübergreifenden Methoden der naturwissenschaftlichen Erkenntnisgewinnung fokussieren. Sofern der Fachinhalt bekannt ist, sollte es daher für die Proband/inn/en keinen Unterschied machen, ob sie Aufgaben einer anderen Naturwissenschaft als der Physik bearbeiten (vgl. Giere et al., 2006; Klahr, 2000). Es werden daher drei Modelle getestet: 1A: eindimensionales Modell 1B: zweidimensionales Modell Physik vs. Biologie & Chemie 1C: dreidimensionales Modell Physik, Biologie, Chemie H1b: Ein in Bezug auf die Arbeitsweisen Untersuchungen und Modelle Nutzen zweidimensionales Modell beschreibt die Daten besser als ein eindimensionales Modell. Auch wenn die oben genannten vorläufigen Ergebnisse auf eine eindimensionale Struktur des Modells hindeuten, die sich auch nach den Arbeitsweisen nicht unterscheiden lässt, so gibt es doch theoretische Gründe, die für eine mehrdimensionale Struktur sprechen. So setzt sich das genutzte Kompetenzstrukturmodell aus zwei ursprünglich getrennten Kompetenzstrukturmodellen zusammen (siehe Abschnitt 3.3). Außerdem ist gerade in der Physik die Unterscheidung nach experimenteller und theoretischer Physik lange etabliert und spiegelt sich auch in der universitären Lehre wider. Eine Unterscheidung nach den beiden Arbeitsweisen könnte daher auch in der Datenstruktur zu finden sein. Von den Kompetenzmodellen her wären auch weitere Unterscheidungen nach den sieben Kompe-
Forschungsfragen und Hypothesen 49 tenzfacetten möglich. Da aufgrund des Multimatrix-Designs aber nur nach Arbeitsweisen und nicht nach den einzelnen Facetten unterschieden wurde, kann es sein, dass diese Unterscheidung, auch wenn sie vorhanden wäre, mit den vorliegenden Daten nicht nachweisbar ist. Es werden die drei folgenden Modelle getestet: 2A: eindimensionales Modell 2B: zweidimensionales Modell nach Arbeitsweisen (Untersuchungen & Modelle Nutzen) 2C: siebendimensionales Modell nach Kompetenzfacetten H1c: Ein eindimensionales Modell beschreibt die Daten besser als ein mehrdimensionales Modell, welches nach Fächern und Arbeitsweisen unterscheidet. Aus theoretischer Sicht ist aus den oben dargestellten Gründen auch eine Unterscheidung nach Fächern und Arbeitsweisen denkbar. Um diese Hypothese zu testen, werden folgende Modelle miteinander verglichen: 3A: eindimensionales Modell 3B: vierdimensionales Modell nach Fächern (Physik vs. Biologie & Chemie) und Arbeitsweisen (Untersuchungen und Modelle nutzen) 3C: sechsdimensionales Modell nach Fächern und Arbeitsweisen
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 50 4.2 Fragen zum Kompetenzstand von Physikstudierenden FF2: Existieren Unterschiede im Kompetenzstand zwischen Lehramtsstudierenden der Physik und Fachstudierenden der Physik? Zunächst stellt sich die Frage, ob es generelle Unterschiede im Kompetenzstand von Lehramtsund Fachstudierenden der Physik gibt. Lehramtsstudierende beginnen das Studium mit geringeren Eingangsvoraussetzungen im Vergleich zu Fachstudierenden der Physik (Albrecht, 2011). Daher ist ein geringerer Kompetenzstand zu Beginn des Studiums zu erwarten. Sollte sich die Lehramtsausbildung aber als wirksamer erweisen als die der Fachstudierenden (vgl. Fragestellung 4), so könnte dieser Effekt aufgehoben werden. H2: Lehramtsstudierende weisen einen geringeren Kompetenzstand als Fachstudierende der Physik auf (sig. (Lehramt) < 0,05). FF3: Existieren Unterschiede im Kompetenzstand Studierender im Bereich der Erkenntnisgewinnung zu verschiedenen Phasen im Studienverlauf? Im Laufe des Studiums besuchen die Studierenden Lehrveranstaltungen, in denen das zu messende Konstrukt explizit, z. B. in Seminaren zur Wissenschaftstheorie, oder implizit, z.B. im Rahmen von Experimentalpraktika, gefördert wird. Mit steigender Semesterzahl wächst auch die Anzahl der Lerngelegenheiten, welche als Prädiktor für den Erwerb von Fachwissen17 aber auch Kompetenz gilt (z. B. Blömeke et al., 2010) Es wird demnach erwartet, dass mit fortschreitendem Studium, auch die Erkenntnisgewinnungskompetenz der Studierenden zunimmt. H3: Der mittlere Kompetenzstand der Studierenden der Physik ist höher, je weiter fortgeschritten die Studierenden im Studium sind (p < 0,05). 17 Im Sinne des Content Knowledge nach Shulman (siehe Abschnitt 2.3)
Forschungsfragen und Hypothesen 51 FF4: Existieren Unterschiede in den Differenzen im Kompetenzstand zwischen Lehramtsstudierenden der Physik und Fachstudierenden zu den unterschiedlichen Phasen des Studiums? Grundsätzlich unterscheidet sich die Ausbildung von Lehramtsstudierenden und Fachstudierenden der Physik im Umfang des Studiums. Lehramtsstudierende beschäftigen sich ungefähr nur die Hälfte der Studienzeit mit Physik, die restliche Zeit wird für das zweite Fach, sowie die lehramtsbezogene Berufswissenschaft aufgewendet. Bezogen auf den Aspekt der naturwissenschaftlichen Erkenntnisgewinnung gibt es Unterschiede bei den experimentellen Praktika. Der Anteil von Experimentalpraktika ist bei Fachstudierenden höher, bei Lehramtsstudierenden sind dafür sogenannte Demonstrationspraktika vorgesehen. Lehramtsstudierende besuchen außerdem Didaktikveranstaltungen, in denen das Thema Erkenntnisgewinnung auch explizit thematisiert werden kann (Deutsche physikalische Gesellschaft, 2014). Mögliche Unterschiede im Kompetenzstand könnten von einer unterschiedlichen Studienzeit herrühren. Gleichzeitig ist aber im Lehramtsstudium eine explizite Förderung dieser Kompetenzen vorgesehen, welche als besonders nützlich angesehen wird (Giere et al., 2006, S. 6). Da sich aus der Theorie nicht ableiten lässt, inwiefern eine explizite Vermittlung eine kürzere Beschäftigungszeit mit dem Thema aufwiegen kann, wird die Nullhypothese geprüft: H4: Es existieren keine Unterschiede in den Differenzen im Kompetenzstand zwischen Lehramtsstudierenden der Physik und Fachstudierenden zu den unterschiedlichen Phasen des Studiums (sig. (Lehramt*Studienphase) > 0,05; 𝟏𝟏−𝜷𝜷≥ 𝟎𝟎,𝟗𝟗𝟎𝟎).18 FF5: Existieren Unterschiede im Kompetenzstand von weiblichen und männlichen Studierenden? Mögliche Unterschiede zwischen den Geschlechtern im Kompetenzstand wurden in verschiedenen Schulleistungstests beforscht. Im Rahmen des IQB-Ländervergleichs (Pant et al., 2013) wurden explizit der Bereich Erkenntnisgewinnung auf derartige Disparitäten 18 Grundsätzlich wird hier davon ausgegangen, dass diese querschnittlich erhobenen Daten auch ein Hinweis auf eine Kompetenzentwicklung im Rahmen des Studiums darstellen.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 58 Die Items werden auf Grundlage des jeweiligen Kompetenzstrukturmodells entwickelt. Sie müssen in einen entsprechenden Kontext eingebettet werden, um dem in der Kompetenzdefinition festgelegten situativen Charakter gerecht zu werden (Mayer & Wellnitz, 2014). Ein Item muss auf eine bestimmte Kompetenzfacette des Modells abzielen und die dafür beschriebenen Kompetenzen umsetzen. Schecker und Parchmann (2006) stellen dazu fest, dass „ein psychometrisch optimales Item [..] sich einer ganz bestimmten Zelle der Kompetenzmatrix zuordnen“ (S. 62) lässt. Entsprechend abgegrenzt müssen Itemstamm und -impuls formuliert sein. Darauf ist ohnehin zu achten, um auszuschließen, dass andere Lösungswege als die intendierten möglich sind (Schecker & Parchmann, 2006). Zusätzlich müssen die Aufgaben so formuliert sein, dass eine Konfundierung mit anderen Kompetenzausprägungen ausgeschlossen ist (Schecker & Parchmann, 2006). Wie oben dargestellt, ist bei der Nutzung von MC-Items besonderes Augenmerk auf die sorgfältige Konstruktion von Attraktor und den Distraktoren zu legen. Letztere müssen Personen, die nicht über die zum Lösen erforderliche Kompetenz verfügen, als plausible Antwortoption(en) erscheinen (Moosbrugger & Kelava, 2012b), wodurch die Möglichkeit des Ratens reduziert werden soll. Die drei Hauptaspekte, die bei der Auswahl der Distraktoren beachtet werden müssen, sind ihre Auswahlwahrscheinlichkeit (Attraktivität), die Ähnlichkeit mit dem Attraktor und ihre eigene Plausibilität (Moosbrugger & Kelava, 2012b). Um diese Punkte zu erfüllen, sind als Quelle der falschen Antwortmöglichkeiten echte Antworten der Proband/inn/en der ‚Fantasie’ des Aufgabenstellers vorzuziehen. Echte, aber falsche Antworten sind meistens authentischer und verhindern dadurch die Möglichkeit, die Aufgaben durch Ausschluss von Antworten zu lösen (Bortz & Döring, 2006). Sadler (1998) nutzte z.B. Interviews zur Generierung von Distraktoren und konnte so einen validen und reliablen MC-Test konstruieren. Neben Interviews wird von anderen Autoren (Bortz & Döring, 2006; Moosbrugger & Kelava, 2012b) vorgeschlagen, die Aufgaben zunächst im offenen Format zu entwickeln und einzusetzen. Die Antworten werden anschließend analysiert und ausgewertet. Die so gewonnenen offenen Antworten der Proband/inn/en können dann als Grundlage für die Konstruktion der MC-Optionen genutzt werden. Die offenen Antworten der Proband/inn/en müssen vor der Nutzung sprachlich vereinheitlicht werden (Burton, Sudweeks, Merrill & Wood, 1991). Während des Konstruktionsprozesses der Items müssen diese laufend durch Expert/inn/en bewertet werden, „die sich sowohl mit dem Modell als auch mit der unterrichtlichen Praxis auskennen.“ (Schecker & Parchmann, 2006, S. 62).
Methoden 59 5.2 Statistische Verfahren zur Auswertung Zur Auswertung von Fragebogen-Studien stehen im Wesentlichen zwei Verfahren zur Verfügung. Zunächst die Klassische Testtheorie (KTT), in der, grob gesagt davon ausgegangen wird, dass sämtliche Aufgaben eines Leistungstests dasselbe messen. Zum anderen die probabilistische Testtheorie (PTT) (bzw. auch Item-Response-Theory (IRT)20). „Der Hauptunterschied zwischen der KTT und der PTT [bzw. IRT] liegt in der messtheoretischen Fundierung. Die KTT nimmt an, dass der Summenwert einer Person in einem Test einen Messwert darstellt und dieser Summenwert Intervallskalenniveau besitzt. Im Rahmen der PTT [bzw. IRT] wird dagegen geprüft, ob es sich bei der Summation der Items überhaupt um eine gültige Verrechnungsvorschrift handelt (Gütekriterium der Skalierbarkeit).“ (Bühner, 2011, S. 300) Mit Modellen der IRT wird auf das dahinter liegende latente Konstrukt geschlossen. Die daraus gewonnenen Personenparameter werden als Angabe über die Ausprägung des latenten Konstruktes (z. B. einer Kompetenz) interpretiert (Wu & Adams, 2007, S. 18ff.). Diese Modelle können die unterschiedlichen Schwierigkeiten von einzelnen Aufgaben berücksichtigen (das Rasch-Modell bzw. das 1-Parameter-Logistisches-Modell (1-PL)) (Neumann, 2014), aber auch unterschiedliche Trennschärfen (das 2-PL-Modell) sowie Rate-Parameter (3-PL) (Moosbrugger, 2012). Bei der Messung von latenten Konstrukten (wie einer Kompetenz), ist die IRT der KTT vorzuziehen (Klieme & Hartig, 2008; Neumann, 2014). Der Vorteil der IRT speziell für die Kompetenzdiagnostik liegt in dem hergestellten Zusammenhang zwischen dem Lösungsverhalten bei der Bearbeitung der entsprechenden Items und dem zugrunde liegenden Kompetenzkonstrukt (Klieme & Hartig, 2008). „Anders als in der KTT kann mit Hilfe der PTT [bzw. IRT] eine konkrete Verhaltensvorhersage getroffen werden: Im Rahmen der PTT [bzw. IRT] kann ermittelt werden, mit welcher Wahrscheinlichkeit eine Person bei Kenntnis der Itemschwierigkeiten und der Personenfähigkeit ein Item löst. Dies ist möglich, da im Rahmen der PTT [bzw. IRT] ein psychologisch plausibler Zusammenhang zwischen Personenfähigkeit und Itemlösungswahrscheinlichkeit angenommen wird.“ (Bühner, 2011, S. 300) Durch die Darstellung von Personenfähigkeiten und Aufgabenschwierigkeiten auf einer Skala kann ein Zusammenhang zwischen der Bearbeitung einer einzelnen Aufgabe und dem Kompetenzstand der Proband/inn/en hergestellt werden (vgl. auch Boone, Staver & Yale, 2014). Dies kann zur Beschreibung von Kompetenzniveaus genutzt werden (Klieme 20 Im Folgenden wird die International gebräuchliche Abkürzung IRT verwendet.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 60 & Hartig, 2008). Ein weiterer Vorteil ist, dass es im Rahmen des RASCH-Modells (als ein Modell der IRT, siehe Abschnitt 5.2.1) möglich ist, trotz fehlender Werte – systematisch oder zufällig – alle Proband/inn/en auf einer Skala darzustellen. Diese Technik ermöglicht den Einsatz von systematisch unvollständigen Testheftdesigns (Multi-MatrixDesign), sodass den Proband/inn/en nur ein Teil der Aufgaben zur Bearbeitung vorgelegt werden muss (Boone et al., 2014). Aufgrund dieser Vorteile der IRT gegenüber der KTT im Bereich der Kompetenzdiagnostik, wird im Folgenden auf die IRT zurückgegriffen. Als Messmodell wird das RASCH-Modell ausgewählt, dass als einziges IRT-Modell die Anforderungen an eine objektive Messung erfüllt und auch höhere Anforderungen an die Daten stellt (siehe Boone et al., 2014, S. 453 ff.). Gleichzeitig ist es ein etabliertes Modell, dass auch z. B. in PISA erfolgreich eingesetzt wurde (OECD, 2009). 5.2.1 Das RASCH-Modell Das einfachste Modell der IRT ist das RASCH-Modell. Dieses ist wie folgt definiert: 𝑃𝑃(𝑥𝑥𝑣𝑣𝑣𝑣)=𝑒𝑒�𝑥𝑥𝑣𝑣𝑣𝑣(𝜉𝜉𝑣𝑣−𝜎𝜎𝑣𝑣)� 1 + 𝑒𝑒(𝜉𝜉𝑣𝑣−𝜎𝜎𝑣𝑣) Dabei gibt 𝑃𝑃(𝑥𝑥𝑣𝑣𝑣𝑣) die Wahrscheinlichkeit an, dass ein/e Proband/in 𝜐𝜐 das Item 𝑖𝑖 löst, mit 𝜉𝜉𝑣𝑣 als individuellem Fähigkeitsparameter eines/-r Probanden/-in 𝜐𝜐 und 𝜎𝜎𝑣𝑣 den Schwierigkeitsparameter des Items 𝑖𝑖. Die Steigung dieser logistischen Funktion ist für alle Aufgaben gleich, lediglich ihre Position kann sich auf der 𝜎𝜎-Achse verschieben. Damit haben alle Items die gleiche Trennschärfe, d. h. die Items trennen alle gleich gut zwischen verschiedenen Fähigkeitsausprägungen der Personen (Rost, 2004, S. 98). Die Items können aber unterschiedliche Schwierigkeiten annehmen (Moosbrugger, 2012). Das RASCH-Modell, wie oben dargestellt, geht also davon aus, dass die Wahrscheinlichkeit, ein Item zu lösen, nur von der Personenfähigkeit und der Aufgabenschwierigkeit abhängt (Itemhomogenität) (Moosbrugger, 2012, S. 229). Verschiedene Punkte können diese Annahme verletzen, weshalb es gilt, diese bei der Testkonstruktion zu berücksichtigen. Dazu zählen die Vermeidung von Raten bei der Aufgabenbearbeitung sowie die Beachtung lokaler Unabhängigkeit der Items. Die Beantwortung eines Items darf also nicht von der Bearbeitung eines anderen abhängig sein (Wu & Adams, 2007, S. 74). RASCH-Analysen sind auch mit kleinen Stichproben ab ca. 16 Proband/inn/en möglich. Durch eine Erhöhung der Stichprobe wird die Itemkalibrierung stabiler. Ab 150 Personen
Methoden 61 geht man davon aus, dass die Stabilität zu 99% in einem Intervall von +/- ½-Logit liegt (Linacre, 1994). Da das RASCH-Modell Personen und Items nicht unterscheidet, gelten die selben Bedingungen auch für die Anzahl der Items (Linacre, 1994). Im Rahmen der RASCH-Analyse stehen verschiedene Statistiken zur Verfügung, um zu prüfen, ob einzelne Items nicht den Bedingungen des RASCH-Modells entsprechen. Auf Grundlage der Infit-Parameter weighted Mean Square (wMNSQ), T-Wert, sowie der klassischen Trennschärfe eines Items und einer optischen Kontrolle der Übereinstimmung des durch das RASCH-Modell angenommenen Verlaufs der Lösungswahrscheinlichkeit (ICC = Item characteristic curve) und dem empirischen Verlauf der Lösungswahrscheinlichkeit des Items, kann eine Abweichung detektiert werden. Der Fit (Passung) der Items auf das RASCH-Modell wird in unstandardisierter Form (als wMNSQ) und als standardisierte T-Statistik ausgegeben (Bond & Fox, 2007, S. 193). Der wMNSQ ist ein Maß für die Abweichung des theoretischen, durch das RASCH-Modell angenommenen, Verlaufs der Lösungswahrscheinlichkeit von dem empirisch beobachteten Verlauf (Bond & Fox, 2007, S. 57). Der Erwartungswert des wMNSQ liegt bei 1. Werte zwischen 0,8 und 1,2 werden als akzeptabel angenommen (Wright & Linacre, 1994). Größere Abweichungen deuten auf ein Problem mit der Aufgabe hin, welches dann in einer inhaltlichen Analyse identifiziert werden muss. Der wMNSQ ist aber stichprobenabhängig, weshalb bei ausreichend großer Proband/inn/enzahl für jedes Item der wMNSQ gegen 1 geht. Durch eine Transformation in eine T-Verteilung kann die Stichprobengröße mit berücksichtigt werden. Die T-Verteilung hat einen Mittelwert von 0 und eine Standardabweichung von 1. Abweichungen T > 2 oder T < 2 zeigen eine signifikante (p < 0,05) Abweichung von dem Modell an (Bond & Fox, 2007, S. 239 ff.). Die klassische Trennschärfe gibt an, inwiefern das Abschneiden in dem spezifischen Item mit dem Abschneiden in dem gesamten Test zusammenhängt. Hierbei sollten die Werte mindesten 0,2 betragen (Wu & Adams, 2007, S. 64). Generell sollten Items mit höherer Trennschärfe genutzt werden. Die Infit-Parameter geben nur durchschnittliche Abweichungen der empirischen Daten vom RASCH-Modell an. Eine optische Überprüfung der ICC (durch das RASCH-Modell angenommener Verlauf der Lösungswahrscheinlichkeit, s. o.) mit dem tatsächlichen (empirischen) Verlauf der Lösungswahrscheinlichkeit kann ebenfalls Probleme der Aufgabe aufdecken (Bond & Fox, 2007, S. 243f.; Embretson & Reise, 2000, S. 234) (so zum Beispiel eine nicht modellkonforme, hohe Lösungswahrscheinlichkeit bei geringen Personen-
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 62 fähigkeiten). Generell sollte bei einem „guten“ Item die theoretische und die empirische Kurve nahe beieinander liegen (Wu & Adams, 2007, S. 69). (Als Anhaltspunkte für die Beurteilung, inwiefern eine deutliche Abweichung vorliegt, können die Beispiele aus Bond und Fox (2007, S. 254f.) dienen). Grundsätzlich gilt bei der Itemselektion aber: „[…] in real-life, no item fits the Rasch model perfectly!” (Wu & Adams, 2007, S. 83). Perfekte Passungen sind also weder bei den Fit-Statistiken noch bei der Analyse der ICC zu erwarten. Je nach Zweck der Erhebung muss die Itemselektion nach unterschiedlichen Kriterien erfolgen. In einer Pilotierung ist es das Ziel, einen Test zu konstruieren, der das zu beobachtende Konstrukt möglichst gut abbildet und daher die besten Items identifizieren sollte. In einer Studie steht das Testinstrument hingegen fest. Das Ziel muss daher sein, aus den vorhandenen Items die meisten Informationen zu erhalten. Entsprechend erfolgt die Itemselektion weniger restriktiv als bei der Pilotierung (Wright & Linacre, 1994). Idealerweise werden alle Items des Tests in die Auswertung mit einbezogen, was bei einer ausführlichen Testkonstruktion auch der Fall sein sollte. Trotzdem sollten auch in einer Hauptstudie die Itemfit-Indices auf Passung überprüft werden. Items werden dann auf Grundlage der Trennschärfe nur noch aussortiert, wenn diese negativ ist. Auch beim optischen Abgleich von ICC mit der Empirie wird defensiv vorgegangen und Items nur ausgeschlossen, wenn die Verläufe gegensätzlich sind. Bezüglich der wMNSQ-Werte werden nur Items mit Werten > 2,0 entfernt, da diese die Messung erheblich stören würden. Items mit wMNSQ-Werten < 1,0 werden gar nicht entfernt (Wright & Linacre, 1994). Entsprechend werden Items auch bei T-Werten von 𝑇𝑇<−2,0 nicht entfernt, da „even an item with a very low mean-square tells us a little something that is new and useful“ (Wright & Linacre, 1994) . 5.2.2 Normierung Die im Rahmen dieser Arbeit untersuchten Fragestellungen beziehen sich auf die Teilstichprobe der Studierenden mit einem Fach Physik. Zur Auswertung der erhaltenen Daten werden die Aufgaben zunächst aber auf Basis der gesamten Stichprobe (Studierende der Fächer Biologie, Chemie und Physik) normiert. Dieses Vorgehen bietet den Vorteil, dass dadurch eine sehr genaue Itemparameterschätzung möglich wird (Linacre, 1994). Die Normierung wird so vorgenommen, dass die Summe der Personenparameter gleich Null
Methoden 63 gesetzt und die Itemschwierigkeiten daran ausgerichtet werden. Dadurch wird eine normorientierte Interpretation der Personenparameter möglich (Rost, 2004, S. 395). Die Normierung muss unabhängig für einund mehrdimensionale Modelle vorgenommen werden. 5.2.3 Personenparameterschätzung Für auf RASCH-Modellen basierende Auswertungen können zur Schätzung von Personenfähigkeiten verschiedene Parameter genutzt werden. In verschiedenen Simulationsstudien (Monseur & Adams, 2009; Wu, 2005) konnte gezeigt werden, dass die häufig genutzten Personenschätzer Weighted Likelihood Estimates (WLE), Maximum Likelihood Estimates (MLE) und Expected A Posteriori Measures (EAP) verschiedene Probleme aufzeigen, wenn damit Gruppenparameter berechnet werden sollen. Für einen derartigen Fall wird die Nutzung von Plausible Values (PVs) empfohlen. PVs sind zufällig gezogene Werte aus der Wahrscheinlichkeitsverteilung der Fähigkeitsparameter eines/-r jeden einzelnen Probanden/-in (Wu, 2005, S. 116). PVs sind aber keine personenbezogenen Testwerte und dürfen dementsprechend nicht zur Individualdiagnose herangezogen werden. Pro Proband/in werden fünf PVs21 gezogen. Jede Analyse muss für jeden PV durchgeführt werden. Anschließend werden die Ergebnisse gemittelt (Monseur & Adams, 2009, S. 6). Dies ist ein ideales Vorgehen. Simulationsstudien zeigten aber, dass schon Berechnungen auf Grundlage eines PVs adäquate Gruppenparameter liefern (Wu, 2005, S. 116). Die Kombination mehrerer PVs und ihrer Varianz berechnet sich folgendermaßen: Der Mittelwert einer Statistik berechnet sich nach (OECD, 2009) 𝜃𝜃=1 𝑀𝑀�𝜃𝜃𝑣𝑣 𝑀𝑀 𝑣𝑣=1 wobei M die Anzahl der PVs ist und 𝜃𝜃 die berechnete Statistik. Die Gesamtvarianz berechnet sich ebenfalls als Mittelwert aus den Einzelvarianzen: 𝜎𝜎(𝜃𝜃) 2=1 𝑀𝑀�𝜎𝜎(𝜃𝜃𝑣𝑣) 2 𝑀𝑀 𝑣𝑣=1 21 Dies ist die Standardeinstellung der Analysesoftware Conquest und wurde auch in PISA so genutzt OECD (2009). Grundsätzlich ist aber auch eine abweichende Anzahl davon möglich.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 64 Die Messvarianz [measurement variance] (B) berechnet sich nach 𝐵𝐵𝑀𝑀=1 𝑀𝑀−1∑(𝜃𝜃𝑣𝑣−𝜃𝜃) 𝑀𝑀 𝑣𝑣=1 ² Beide Varianzen werden zur Fehlervarianz [error variance] (V) wie folgt kombiniert: 𝑉𝑉=𝜎𝜎(𝜃𝜃) 2+�1 + 1 𝑀𝑀�𝐵𝐵𝑀𝑀 Die Standardabweichung der Gesamtgruppe entspricht dann der Quadratwurzel aus der Fehlervarianz 𝜎𝜎(𝐺𝐺𝐺𝐺𝐺𝐺𝜃𝜃)=√𝑉𝑉 (Davier, Gonzales & Mislevy, 2009; OECD, 2009) Der Standardfehler eines Mittelwerts berechnet sich nach 𝑆𝑆𝑆𝑆 =𝜎𝜎 √𝑁𝑁 , wobei N die Stichprobengröße ist (Bühner & Ziegler, 2009, S. 156). Sollen Gruppenunterschiede wie Geschlecht, Semester etc. auf Grundlage von PVs eingeschätzt werden, so müssen die jeweiligen Variablen bereits bei der IRT-basierten Schätzung der Personenfähigkeiten als Prädiktoren in ein latentes Regressionsmodell einfließen (s. u.) (Wu, 2005, S. 124). 5.2.4 Latentes Regressionsmodell Eine Regression ist eine Methode zur Vorhersage einer abhängigen Variable in Abhängigkeit von einer oder mehrerer unabhängiger Variablen. Dieses kann als lineares Modell aus den erhaltenen Messdaten ermittelt werden (Field, 2009, S. 198). Ein latentes Regressionsgrundmodell wird direkt innerhalb des IRT-Modells geschätzt, nicht erst auf Grundlage der Personenparameter. Dies umgeht Probleme, die durch die verschiedenen Personenschätzer resultieren können (Adams & Wu, 2010). Als Ergebnisse erhält man Regressionsgewichte, die angeben, um wieviel sich die abhängige Variable ändert, wenn sich die unabhängige Variable um eine Einheit ändert (Field, 2009, S. 204). Liegen die interessierenden Variablen in nominaler oder ordinaler Form vor (z. B. Geschlecht), müssen diese vorher dummy-codiert werden (Bortz, 2005, S. 483).
Methoden 65 5.2.5 Dimensionsanalyse Ein eindimensionales RASCH-Modell geht davon aus, dass allen Items dieselbe latente Variable zugrunde liegt. Gibt es aber theoretische Gründe, eine mehrdimensionale Struktur der Daten anzunehmen, so lässt sich dies mit mehrdimensionalen RASCH-Analysen modellieren. Mit Hilfe der Deviance-Statistik und Informationskriterien lässt sich die Passung der Modelle vergleichen. Dabei wird davon ausgegangen, dass kein Modell die Daten perfekt beschreibt, stattdessen sucht man das Modell, welches die Daten am besten beschreibt (Bühner, 2011, S. 541). Die Deviance-Statistik dient als Maß dafür, wie gut das Modell auf die Daten passt (Wu, Adams, Wilson & Haldane, 2007). Ein kleinerer Wert steht hier für eine bessere Passung. Durch einen 𝜒𝜒2-Differenzentest lässt sich prüfen, ob die bessere Passung nach der Deviance-Statistik signifikant ist. Allerdings ist dies an die Bedingung geknüpft, dass die Modelle genestet sind, d. h. ein Modell muss das Obermodell des anderen getesteten Modells sein (Bühner, 2011, S. 348f.).22 Das Nutzen von mehrdimensionalen Modellen geht mit einer Zunahme der Freiheitsgerade einher, was dem Prinzip der Einfachheit von Modellen widerspricht. Daher bieten sich informationstheoretische Maße an, die jeden zusätzlichen Freiheitsgrad bestrafen (Bühner, 2011, S. 541). Das Bedeutet, dass die bessere Passung des Modells ins Verhältnis zur Zunahme der Komplexität des Modells gesetzt wird. Bei einer großen Anzahl von Items wird das Bayesian Information Criterion (BIC) als geeignetes Maß genannt (Rost, 2004, S. 344). Es wird außerdem angeraten, dieses in Kombination mit dem Consistent Akaike Information Criterion (CAIC) einzusetzen (Bühner, 2011, S. 353). 5.2.6 Differential Item Functioning (DIF) Ein „Differential Item Functioning“ (im weiteren „DIF“) liegt vor, wenn Personen aus zwei Gruppen bei bestimmten Items trotz gleicher Personenfähigkeit eine unterschiedliche Wahrscheinlichkeit aufweisen, das Item zu lösen (Embretson & Reise, 2000, S. 252). Bestimmte Gruppen werden also durch diese Items systematisch bevorzugt oder benachteiligt. Das Item weist für die beiden Gruppen unterschiedliche Itemfunktionen auf. Zur Detektion von DIF stehen verschiedene Verfahren zur Verfügung, so zum Beispiel eine auf dem RASCH-Modell basierende Technik zur Schätzung von DIF, sowie die MantelHaenszel-Methode (MH). Letztere ist eine lang etablierte Methode zu Schätzung von DIF. Während andere Methoden dazu tendieren, Items mit DIF zu identifizieren, auch 22 Der 𝜒𝜒2-Differenzentest ist u.a. auch daran geknüpft, dass jedes einzelne Antwortmuster mindestens einmal im Datensatz auftaucht. Dieses ist sehr unwahrscheinlich, weshalb die Ergebnisse kritisch betrachtet werden müssen (Bühner (2011, S. 348))
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 66 wenn kein DIF vorliegt, so soll die MH die besten Erkennungsraten vorweisen (GÓMEZ-BENITO & Navas-ara, 2000). Üblicherweise werden in der MH matched groups verglichen, die auf Basis der Rohwerte zusammengestellt werden. In der hier benutzten Software Conquest kann die MH stattdessen mit PVs durchgeführt werden. Dieser Ansatz soll für unvollständige Testheftdesigns geeignet sein (Sun, 2012). Die einzelnen Items werden gemäß den ETS23-DIF-Kategorien (Zwick, Thayer & Lewis, 1999) eingeteilt (Sun, 2012). Aus der Analyse ausgeschlossen werden Items, wenn sie in die Kategorie „CModerate to large“ fallen. 5.2.7 Mittelwertsvergleiche Mithilfe eines T-Tests lassen sich Unterschiede zwischen zwei Mittelwerten ermitteln (Field, 2009, S. 325). Die Proband/inn/engruppen, die untereinander verglichen werden, sind unterschiedliche Personen, dementsprechend muss der T-Test für unabhängige Stichproben genutzt werden. Man spricht von einem signifikanten Unterschied der Mittelwerte, wenn die Wahrscheinlichkeit eines α-Fehlers kleiner als 5 % ist. Dies zeigt sich anhand eines p-values von p < 0,05. Der Test setzt eine Normalverteilung der Messwerte der Proband/inn/en in beiden Stichproben und eine annährungsweise Homogenität in den Varianzen voraus (Field, 2009, S. 326). Bei Verletzung der Annahmen für den T-Test können parameterfreie Tests wie der Mann-Whitney-Test eingesetzt werden (Field, 2009, S. 546ff.). Bei dem Vergleich von mehr als zwei Mittelwerten bietet sich der Einsatz einer ANOVA (Analysis of Variance) an. Diese prüft, ob mehrere Mittelwerte dem gleichen gemeinsamen Mittelwert angehören. Dies geschieht durch eine Analyse der Varianz (Field, 2009, 348f.). Voraussetzungen für die ANOVA sind ebenfalls eine annähernd homogene Varianz und Normalverteilung in den Gruppen (Field, 2009, 359). Die gesamte Varianz einer Stichprobe unterteilt sich in die systematische (Effekt-) Varianz und der Residualvarianz. Die systematische Varianz ist der Teil der Varianz, der durch die Zugehörigkeit zu einer Gruppe erzeugt und kontrolliert wird. Die Residualvarianz hingegen umfasst unsystematische Einflüsse, die nicht erfasst wurden bzw. nicht intendiert sind (Rasch, Friese, Hofmann & Naumann, 2014). Beide Anteile der Varianz be23 Educational Testing Service
Methoden 67 rechnen sich aus den Quadratsummen und den jeweiligen Freiheitsgeraden. Für die systematische (Effekt-)Varianz gilt: 𝜎𝜎𝐸𝐸𝐸𝐸𝐸𝐸 2=𝑄𝑄𝑆𝑆𝐸𝐸𝐸𝐸𝐸𝐸 𝑑𝑑𝑑𝑑𝐸𝐸𝐸𝐸𝐸𝐸 𝑄𝑄𝑆𝑆𝐸𝐸𝐸𝐸𝐸𝐸 wird aus dem Abstand des Mittelwertes zum Gesamtmittelwert berechnet. Entsprechend gilt für die Residualvarianz 𝜎𝜎𝑅𝑅𝐺𝐺𝐺𝐺 2=𝑄𝑄𝑆𝑆𝑅𝑅𝐺𝐺𝐺𝐺 𝑑𝑑𝑑𝑑𝑅𝑅𝐺𝐺𝐺𝐺 𝑄𝑄𝑆𝑆𝑅𝑅𝐺𝐺𝐺𝐺 berechnet sich als Summe aus den Abständen eines jeden einzelnen Wertes zu seinem Gruppenmittelwert. Der F-Wert errechnet sich aus dem Verhältnis beider Varianzen (Rasch et al., 2014): 𝐹𝐹=𝜎𝜎𝐸𝐸𝐸𝐸𝐸𝐸 2 𝜎𝜎𝑅𝑅𝐺𝐺𝐺𝐺 2 Durch Abgleich mit kritischen F-Werten lässt sich die Signifikanz eines Effektes prüfen. (Rasch et al., 2014) Bei nicht signifikanten Effekten muss zusätzlich die Teststärke (Power, 1−𝛽𝛽) berechnet werden, um auszuschließen, dass die Alternativhypothese fälschlicherweise abgelehnt wurde. Üblicherweise wird in diesem Fall als Power zumindest 1−𝛽𝛽 = 0,8 gefordert (Rasch et al., 2014, S. 57). 5.2.8 Prüfung von Normalverteilung und Varianzhomogenität Die Normalverteilung kann durch einen Kolmogoroff-Smirnoff-Test (K-S) und einen Shapiro-Wilk-Test (S-W) überprüft werden (Field, 2009, S. 144ff.). Beide vergleichen die Verteilung der Testwerte mit einer Normalverteilung bei gleichem Mittelwert und Standardabweichung. Der S-W-Test ist sensitiver als der K-S-Test und zeigt daher eher eine Abweichung von der Normalverteilung an. Wird der Test signifikant (p < 0,05), liegt eine signifikante Abweichung von der Normalverteilung vor. Zusätzlich können durch die Werte von Schiefe ν und Kurtosis w Abweichungen in der Verteilung identifiziert werden. Beide Werte haben den Normwert 0. Werte niedriger als 0 deuten auf eine linksschiefe bzw. flachgipfelige Verteilung, Werte größer als Null auf eine rechtsschiefe bzw. spitzgip-
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 74 Entwicklung der Aufgabe: In den Itemstamm wurde in der geschlossenen Version der Aufgabe die Klarstellung „z. B. Sonnenblumenöl“ zusätzlich eingefügt. Dadurch sollte der Alltagsbezug des Items deutlicher werden. Tabelle 3: Erläuterungen zu den MC-Optionen und Beispielantworten der Studierenden zum Aufgabenbeispiel „Hypothese“ MC 1 Attraktor Die erste MC-Option (Attraktor) ist eine prüfbare und korrekte Hypothese, auch wenn sie fachlich falsch ist. Beispielantworten von Studierenden: „Je größer die Oberfläche der Blasen ist, desto mehr sind sie mit Luft gefühlt [sic] und steigen deswegen schneller in öligen Flüssigkeiten auf.“ „Die Auftriebskraft von Luftblasen ist abhängig von der sich darin befindlichen Luftmasse.“ „Große Luftblasen (mehr Luft) steigen in Öl schneller auf als kleinere Luftblasen (weniger Luft) aufgrund ihres Luftverhältnisses.“ „Eine große Menge an Sauerstoff in einer Luftblasse bedeutet eine hohe Auftriebskraft.“ 2 Distraktor Die zweite MC-Option (Distraktor) betrifft lediglich die Zähflüssigkeit und damit nicht die Ursache für das Phänomen. Außerdem ist sie uneindeutig formuliert, da sie zwei Ursachen für die Zähflüssigkeit prüfen will. Beispielantworten von Studierenden: „Viskosität eines Stoffes hängt vom Stoff selbst ab und von der Größe des Fremdkörpers“ 3 Distraktor Die dritte MC-Option (Distraktor) fokussiert ebenfalls falsch, weil nur die Ursache für die Auftriebskraft erklärt werden soll. Beispielantworten von Studierenden: „[…]Luft weist eine geringere Dichte als Öl auf.“ 4 Distraktor Die vierte MC-Option (Distraktor) beschreibt lediglich das Phänomen und kann es dadurch auch nicht erklären. Beispielantworten von Studierenden: „[…]je größer die Luftblase erscheint, desto schneller entweicht die Luftblase nach oben. […]“
Testkonstruktion 75 Abbildung 4: ICC zum Aufgabenbeispiel „Hypothese“ Tabelle 4: Item-Fit-Werte zum Aufgabenbeispiel „Hypothese" Logit wMNSQ T discr. 1,07 0,99 0,0 0,16 Einschätzung Die Aufgabe weist zufriedenstellende Itemfit-Parameter auf (siehe Tabelle 4), wurde aber aufgrund der geringen Trennschärfe und der ungenügenden Übereinstimmung von theoretischem und empirischem Verlauf der ICC (siehe Abb. 4) im Rahmen der Pilotierung aus dem Test entfernt. Eventuelle inhaltliche Gründe könnten sein, dass sich Studierende mit höherem Kompetenzstand durch die etwas umgangssprachliche Formulierung des Attraktors irritiert fühlten. Außerdem könnte das Fehlen der – möglicherweise einigen Proband/inn/en bekannten – richtigen Erklärung (Anstieg der Auftriebskraft mit r³ - Anstieg der der Stokesreibung mit r) zusätzlich zu Irritationen geführt haben.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 76 6.2.2 Aufgabenbeispiel 2: „Planung und Durchführung“ Die Kompetenzfacette „Planung und Durchführung“ (Dimension Naturwissenschaftliche Untersuchungen, siehe Abschnitt 3.4.1) umfasst auch das Erkennen von Störvariablen bzw. nicht kontrollierten Variablen. Im Folgenden Beispiel wird wieder auf einen Alltagskontext Bezug genommen (Rollen auf einer schiefen Ebene). Der Einfluss unterschiedlicher Oberflächen ist zum einen aus dem Alltag bekannt, allerdings wird dieses Thema auch in der Schule thematisiert (Kultusministerkonferenz, 2005). Den Proband/inn/en werden eine Hypothese und ein entsprechender experimenteller Aufbau genannt. Dieser soll bewertet werden, inwiefern er zur Prüfung der Hypothese geeignet ist. Um diese Aufgabe lösen zu können, müssen die Proband/inn/en aus der Hypothese zunächst die abhängige und die unabhängige Variable identifizieren. Weiterhin müssen sie diese Erkenntnisse dann auf den experimentellen Aufbau übertragen und darin eventuelle Störvariablen erkennen. Die Proband/inn/en müssen erkennen, dass der Einfluss der Oberflächen der Rampen nicht berücksichtigt wurde und daher diese als Störvariable fungieren kann.
Testkonstruktion 77 Abbildung 5: Aufgabenbeispiel "Planung und Durchführung" (offen) Schiefe Ebene Man lässt drei Bälle jeweils eine Rampe herab rollen. Die Endgeschwindigkeit wird mit einer Messeinrichtung am Fuße der Rampe bestimmt. Das Gewicht der drei Bälle und die Oberflächenbeschaffenheit sind jeweils gleich. Die erste Rampe ist höher als die zweite und dritte Rampe, davon abgesehen sind sie identisch. Sie möchten mit einem Versuch die folgende Hypothese prüfen: „Die Höhe einer Rampe hat Einfluss auf die Endgeschwindigkeit eines herabrollenden Balls.” Sie nutzen dazu eine Spielplatzrutsche und eine halb so hohe, gleich lange Rampe aus Holz, die Sie selber bauen. Die Endgeschwindigkeit wird am Fuße der Rampen mit einer Messeinrichtung bestimmt. Beurteilen Sie den beschriebenen Versuchsaufbau im Hinblick auf die zu prüfende Hypothese und begründen Sie ihre Einschätzung.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 78 Abbildung 6: Aufgabenbeispiel "Planung und Durchführung" (geschlossen) Schiefe Ebene Sie möchten mit einem Versuch die folgende Hypothese prüfen: „Die Höhe einer Rampe hat Einfluss auf die Endgeschwindigkeit eines herabrollenden Balls.” Sie nutzen dazu eine Stahlrutsche auf einem Spielplatz und eine halb so hohe, gleich lange Rampe aus Holz, die Sie selber bauen. Die Endgeschwindigkeit wird am Fuße der Rampen mit einer Messeinrichtung bestimmt. Wie schätzen Sie den Versuchsaufbau im Hinblick auf die zu prüfende Hypothese ein? Kreuzen Sie an. Der Aufbau ist geeignet. Man muss aber beide Male den gleichen Ball benutzen und darauf achten, dass dieser rollt und nicht rutscht. Der Aufbau ist geeignet. Die Rutsche muss aber 50 cm länger sein als die Rampe, damit der Effekt gut sichtbar ist. Der Aufbau ist ungeeignet. Der Einfluss der Oberflächen wird nicht berücksichtigt. Der Aufbau ist ungeeignet. Fachlich korrekter wäre es den Einfluss des Neigungswinkels auf die Endgeschwindigkeit zu untersuchen.
Testkonstruktion 79 Entwicklung der Aufgabe: Im Itemstamm wurde der erste Absatz entfernt, der fälschlicherweise in der PräPilotierung in der Aufgabe enthalten war. Tabelle 5: Erläuterungen zu den MC-Optionen und Beispielantworten der Studierenden zum Aufgabenbeispiel "Planung und Durchführung" MC 1 Distraktor Diese Option zeigt Ansätze von einem Verständnis zur Variablenkontrolle (Ball), allerdings bleiben die unterschiedlichen Oberflächen unberücksichtigt. Beispielantworten von Studierenden: „Die Rotationsenergie beeinflusst den Ausgang des Experiments. Um diesen Einfluss gering zu halten, sollte man ein und denselben Ball benutzen und darauf achten, dass der Ball rollt und nicht rutscht.“ 2 Distraktor Die zweite MC-Option (Distraktor) verändert eine zusätzliche Variable im Aufbau und ist daher ebenfalls falsch. Beispielantworten von Studierenden: „wird funktionieren, Rutsche sollte nur etwas länger sein (mind. 50 cm), um Effekt gut sehen zu können“ 3 Attraktor Diese Option erkennt den Einfluss der unterschiedlichen Oberflächen auf den Ausgang des Experiments. Beispielantworten von Studierenden: „Der Schwachpunkt des Versuchs liegt bei der unterschiedlichen Oberflächenbeschaffung der Rutsche / Holzrampe“ „Oberflächenbeschaffenheit der gewählten Rampen sind unterschiedlich man verändert mehr als eine Sache -> keine genaue Aussage möglich“ „Bei dem Versuch wird nicht die Materialeigenschaft miteinbezogen. Spielplatzrutsche besteht aus Metall, selbstgebaute Rampe aus Holz. Die Reibung müßte also auch beachtet werden.“ 4 Distraktor Diese Option schätzt den Aufbau als ungeeignet ein, sieht aber das Problem in einer falschen Hypothese. Beispielantworten von Studierenden: „[…] besser: der Neigungswinkel hat Einfluss auf…“
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 80 Abbildung 7: ICC des Aufgabenbeispiels "Planung und Durchführung" Tabelle 6: Item-Fit-Werte des Aufgabenbeispiels "Planung und Durchführung" Logit wMNSQ T discr. 0,604 1,02 0,2 0,23 Einschätzung Die Aufgabe weist zufriedenstellende Itemfit-Parameter auf (siehe Tabelle 6), auch wenn die klassische Trennschärfe etwas gering ausfällt. Der Vergleich von theoretischer ICC und dem empirischen Verlauf der Lösungswahrscheinlichkeiten ist nicht zufriedenstellend (siehe Abbildung 7). Aus diesem Grund wurde die Aufgabe aus dem Itempool entfernt. Eine Evaluation dieser Aufgabe ist schwierig, da für sie nur 15 gültige Antworten vorliegen. Möglicherweise wäre bei einer größeren Anzahl von gültigen Antworten die Aufgabe im Test verblieben. Da ausreichend Items zu dieser Facette des Kompetenzmodells vorhanden waren, wurde dies aus pragmatischen Gründen nicht weiter verfolgt.
Testkonstruktion 81 6.2.3 Aufgabenbeispiel 3: „Auswertung und Interpretation“ Die Dimension Naturwissenschaftliche Untersuchungen umfasst auch die Facette „Auswertung und Interpretation“ von Daten. In der hier dargestellten Aufgabe sollen die Ergebnisse einer Messung mit einem Geiger-Müller-Zählrohr interpretiert werden. Das Thema zählt zum Schulwissen und wird bis zum Ende der 10. Jahrgangstufe im Physikunterricht behandelt (Kultusministerkonferenz, 2005). Um dieses Vorwissen zu wiederholen, werden sämtliche relevanten Aspekte innerhalb des Itemstamms wiederholt. Inhaltliche Grundlage dieser Aufgabe ist ein Experiment aus dem Schüler/innen/labor „PhysLab“ (PhysLab, 2014). Gemäß der oben genannten Operationalisierung der Kompetenzfacette (siehe Abschnitt 3.4.1) umfassen Aufgaben dieser Facette auch die Auswertung von Daten, die im Rahmen von Experimenten gewonnen wurden. Im Fokus dieser Aufgabe stehen der Umgang mit tabellarisch dargestellten Daten und die Interpretation dieser in Bezug auf die Wirkung von Blei zwischen Präparat und Zählrohr. Dabei müssen die Proband/inn/en zunächst die tabellarische Darstellung interpretieren. Außerdem müssen Sie die Bedeutung der einzelnen Zahlenwerte (als ein Impuls) erkennen und verstehen, dass es zu statistischen Schwankungen kommt.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 82 Abbildung 8: Aufgabenbeispiel „Auswertung und Interpretation“ (offen) Radioaktivität Ein Geiger-Müller-Zählrohr kann radioaktive Strahlung detektieren. Es gibt pro detektiertem Strahlungsteilchen einen Impuls (Imp.) an ein Zählgerät weiter. Somit können Impulse nur als ganze Zahlen auftreten. Ein detektiertes Strahlungsteilchen deutet auf einen Zerfall eines Atomkernes in der Umgebung des Geiger-Müller-Zählrohres hin. Durch in der Luft vorkommende natürliche Radionuklide wie Rn-222 besteht immer ein natürlicher Strahlungshintergrund, der mit der sogenannten Nullzählrate erfasst wird. Diese muss für jeden Ort neu bestimmt werden, weil sie stark von den Gegebenheiten der Umgebung abhängt. Sie befestigen ein Ra-226-Präparat in einem Abstand von s = 1 cm vor einem GeigerMüller-Zählrohr. Zwischen Zählrohr und Präparat werden nacheinander mehrere b = 2 mm starke Bleiplatten eingebracht und jeweils für den Zeitraum von t = 60 s die Impulse gemessen. Sie erhalten folgende Messreihen, wobei die Nullzählrate von 𝑁𝑁0=17 𝐼𝐼𝐼𝐼𝐼𝐼. 60𝐺𝐺 schon berücksichtigt ist: Stärke der Bleiplatten N-N0 N-N0 N-N0 ohne Bleiplatten 39341 40084 40034 2 mm 169 166 161 4 mm 151 142 147 6 mm 144 131 126 8 mm 123 130 133 10 mm 131 124 121 Interpretieren Sie das Ergebnis bezüglich der Wirkung von Blei zwischen Präparat und Zählrohr.
Testkonstruktion 83 Abbildung 9: Aufgabenbeispiel „Auswertung und Interpretation“ (geschlossen) Radioaktivität Ein Geiger-Müller-Zählrohr kann radioaktive Strahlung detektieren. Es gibt pro detektiertem Strahlungsteilchen einen Impuls (Imp.) an ein Zählgerät weiter. Somit können Impulse nur als ganze Zahlen auftreten. Ein detektiertes Strahlungsteilchen deutet auf den Zerfall eines Atomkerns in der Umgebung des Geiger-Müller-Zählrohres hin. Durch in der Luft vorkommende natürliche Radionuklide wie Radon (Rn-222) besteht immer ein natürlicher Strahlungshintergrund, der mit der sogenannten Nullzählrate erfasst wird. Diese muss für jeden Ort neu bestimmt werden, weil sie stark von den Gegebenheiten der Umgebung abhängt. Sie befestigen ein Radium-Präparat (Ra-226) in einem Abstand von s = 1 cm vor einem Geiger-Müller-Zählrohr. Zwischen Zählrohr und Präparat werden nacheinander mehrere, jeweils b = 2 mm starke Bleiplatten eingebracht und jeweils für den Zeitraum von t = 60 s die Impulse gemessen. Sie erhalten folgende Messreihen, wobei die Nullzählrate von 𝑁𝑁0=17 𝐼𝐼𝐼𝐼𝐼𝐼. 60𝐺𝐺 schon berücksichtigt ist: Stärke der Bleiplatten N-N0 N-N0 N-N0 ohne Bleiplatten 39341 40084 40034 2 mm 169 166 161 4 mm 151 142 147 6 mm 144 131 126 8 mm 123 130 133 10 mm 131 124 121 Welche Interpretation lässt die Messreihe bezüglich der Wirkung von Blei zwischen Präparat und Zählrohr zu? Kreuzen Sie an. Je dicker eine Bleiplatte ist, desto weniger radioaktive Strahlung wird detektiert. Je stärker die Bleiplatten, desto geringer ist die Stärke der gemessenen Impulse. Durch die Bleiplatten wird radioaktive Strahlung abgeschirmt. Der Schutz vor radioaktiver Strahlung steigt mit jeder zusätzlichen Bleiplatte deutlich an.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 90 6.3 Beschreibung des fertigen Tests Der fertige Kompetenztest besteht aus 123 Items, die sich wie folgt über die einzelnen Fächer, Dimensionen und Kompetenzfacetten verteilen: Tabelle 11: Übersicht über die Items (B=Biologie, C=Chemie, P=Physik) Naturwissenschaftliche Erkenntnisgewinnung Naturwissenschaftliche Untersuchungen Fragestellungen Hypothesen Planung und Durchführung Auswertung und Interpretation Items B:6 C:5 P:8 B:6 C:4 P:7 B:8 C:5 P:9 B:7 C:4 P:6 Modelle Nutzen Zweck von Modellen Testen von Modellen Ändern von Modellen Items B:3 C:7 P:6 B:6 C:5 P:7 B:6 C:3 P:5 Die Länge eines Testheftes wird durch verschiedene Faktoren begrenzt. So muss die zeitliche Belastung, der die Proband/inn/en ausgesetzt werden, zumutbar sein (Moosbrugger & Kelava, 2012a), wodurch auch Ermüdungserscheinungen vorgebeugt werden sollen. Außerdem wird durch institutionelle Vorgaben (Lehrveranstaltungen, in denen der Test eingesetzt werden soll) die Testzeit durch externe Faktoren ebenfalls limitiert (Mayer & Wellnitz, 2014). Um diese Einschränkungen zu berücksichtigen, gleichzeitig aber der Breite der Kompetenz mit seinen 123 konstruierten Aufgaben gerecht zu werden, wurden die Aufgaben im Multi-Matrix-Design27 über mehrere Testhefte verteilt. Dieses Vorgehen ist mit der Einschränkung verbunden, dass sich die erhobenen Daten weniger zur Feststellung individueller Personenparameter eignen. Zur Schätzung von Gruppenfähigkeiten können die Daten aber weiterhin genutzt werden (Gonzales & Rutkowski, 2010, S. 126). Aus den Erfahrungen der Pilotierungsstudie wurde die Anzahl der Items auf 18 pro Testheft festgelegt. Die Domäne Physik ist daher mit sechs Items in jedem Testheft vertreten, die anderen beiden Fächer jeweils auch mit sechs. Damit sollte eine Testzeit von ca. 30 27 Das hier dargestellte Design wurde innerhalb des Gesamtprojekts Ko-WADiS entworfen und nicht speziell für diese Dissertation.
Testkonstruktion 91 Minuten erreicht werden. Die Items wurden im Rotationsdesign auf die Testhefte verteilt. Zunächst wurden für die beiden Dimensionen Naturwissenschaftliche Untersuchungen und Modelle Nutzen Blöcke von je drei Items gebildet. Dadurch wird erreicht, dass in jedem Testheft jede Dimension und jedes Fach mit mindestens drei Items vertreten ist (Gonzales & Rutkowski, 2010, S. 130). Diese werden entsprechend Tabelle 12 über 20 Testhefte verteilt. Um alle Proband/inn/en unabhängig vom bearbeiteten Testheft auf einer Skala abbilden zu können, müssen die Testhefte untereinander verlinkt werden. Dies wird in diesem Fall durch Ankerblöcke erreicht, die jeweils in mindestens zwei Testheften vorkommen (Frey, Hartig & Rupp, 2009, S. 43). Sowohl die Fächer als auch die Blöcke wechseln die Position innerhalb der Testhefte, um entsprechenden Positionseffekten entgegenzuwirken (Gonzales & Rutkowski, 2010, S. 135f.). Durch die unterschiedliche Anzahl von Items pro Fach und Dimension ergibt sich ein unbalanced28 incomplete29 Testdesign (Gonzales & Rutkowski, 2010). Tabelle 12: Übersicht über das Rotationsdesign (P=Physik, C=Chemie, B=Biologie, U=Untersuchungen, M=Modelle) TH30 TH31 TH32 TH33 TH34 TH35 TH36 TH37 TH38 TH39 PU1 BU2 CU1 PU3 BU5 CU2 PU4 BU8 CU3 PU6 PM1 BM2 CM3 PM2 BM5 CM4 PM4 BM3 CM5 PM5 CU1 PU2 BU3 CU2 PU3 BU6 CU3 PU5 BU9 CU4 CM1 PM1 BM3 CM2 PM3 BM1 CM3 PM4 BM4 CM4 BU1 CU1 PU2 BU4 CU2 PU4 BU7 CU3 PU5 BU1 BM1 CM4 PM2 BM4 CM5 PM3 BM2 CM1 PM5 BM5 TH40 TH41 TH42 TH43 TH44 TH45 TH46 TH47 TH48 TH49 BU2 CU4 PU7 BU5 CU5 PU9 BU8 CU6 PU10 BU2 BM1 CM1 PM1 BM4 CM2 PM2 BM2 CM3 PM4 BM5 PU6 BU3 CU5 PU8 BU6 CU6 PU9 BU9 CU1 PU1 PM6 BM2 CM5 PM1 BM5 CM1 PM3 BM3 CM2 PM5 CU4 PU7 BU4 CU5 PU8 BU7 CU6 PU10 BU1 CU4 CM2 PM6 BM3 CM3 PM2 BM1 CM4 PM3 BM4 CM5 28 Die Blöcke tauchen unterschiedlich oft im Testheft auf. 29 Nicht alle Proband/inn/en erhalten alle Aufgaben.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 92 In der Anfangsphase der Erhebungen wurde ein leicht anderes Design eingesetzt, was vom Grundprinzip aber dem oben angegebenen entspricht. Da später noch sechs weitere Aufgaben hinzugenommen wurden, wurde das Design entsprechend angepasst. Für die im Anschluss durchgeführten Auswertungen werden alle Fälle unabhängig vom Testheftdesign verwendet. Dies kann geschehen, weil beide Designs untereinander durch die 117 Aufgaben, die in beiden Designs vorhanden sind, geankert sind. 6.3.1 Testgüte Die Güte eines Tests wird häufig durch die drei Kriterien Objektivität, Reliabilität und Validität beschrieben (Moosbrugger & Kelava, 2012a). Objektiv ist ein Test, wenn das gemessene Merkmal unabhängig von Testleiter und -auswerter gemessen wird. Außerdem müssen für die Interpretation ebenso klare Regeln existieren. Es werden die drei Aspekte Durchführungs-, Auswertungsund Interpretationsobjektivität unterschieden (Moosbrugger & Kelava, 2012a, S. 8). Die Durchführungsobjektivität betrifft die Bedingungen, unter denen der Test durchgeführt wird. Im Rahmen unseres Tests wurde diese durch ein einheitliches Instruktionsblatt gewährleistet. Inhaltliche Fragen wurden während des Testes nicht beantwortet. Die durch äußere Rahmenbedingungen häufig abweichende Testzeit wurde dadurch berücksichtigt, dass nicht bearbeitete Aufgaben am Ende des Testheftes als missing not reached kodiert wurden. Dadurch wurde in der Auswertung die Aufgabe so gewertet wie alle anderen, bedingt durch das Multi-Matrix-Design, nicht vorliegenden Aufgaben. Die Auswertungsobjektivität wird durch den ausschließlichen Einsatz von Multiple-Choice-Aufgaben gewährleistet (Hartig & Jude, 2007, S. 30). Falscheingaben beim Abtippen der Testhefte wurden durch eine Kontrolle von 10% der Eingaben und einer augenscheinlichen Kontrolle der Muster der Testhefte in den Dateien vorgebeugt. Die Interpretationsobjektivität wird durch den geringen Spielraum bei der Interpretation von MC-Aufgaben unterstützt. Die Reliabilität eines Testes gibt an, wie exakt der Test das fokussierte Konstrukt misst, wie groß also der Messfehler ist. Im Rahmen der RASCH-Modellierung wird ein Reliabilitätsmaß (EAP/PV-Reliabilität) geschätzt, wobei einige Einschränkungen zu berücksichtigen sind (Adams, 2005). Die Diskussion der Reliabilität erfolgt nach der Auswertung im Ergebnisteil dieser Arbeit. „Ein Test gilt dann als valide [.], wenn er das Merkmal, das er messen soll, auch wirklich misst und nicht irgendein anderes.“ (Moosbrugger & Kelava, 2012a, S. 13). Dieser Definition folgend, beschäftigt sich die Validität also vor allem mit den inhaltlichen Aspekten eines Tests. Daher ist dieser Punkt als notwendiges Kriterium der Testgüte anzusehen. Wenn durch
Testkonstruktion 93 den Test etwas anderes als das intendierte Konstrukt gemessen wird, ist der Test nicht mehr einzusetzen (Hartig, Frey & Jude, 2012, S. 144). Als wesentliche Aspekte der Validität werden die Punkte Inhaltsvalidität, Kriteriumsvalidität und Konstruktvalidität angesehen (Schmiemann & Lücken, 2014; Schnell, Hill & Esser, 2011). Die Diskussion der Validität dieses Test soll sich auf diese Punkte beschränken (vgl. Hartig & Jude, 2007), auch wenn in der Forschung noch weitere Aspekte der Validität diskutiert werden (z. B. Messick, 1995). Die Inhaltsvalidität beschäftigt sich mit der Frage, ob „möglichst alle Aspekte der Dimension, die gemessen werden sollte, berücksichtigt wurden.“ (Schnell et al., 2011, S. 141). Schon bei der Konstruktion des Testes muss dieser Punkt beachtet werden (Schmiemann & Lücken, 2014). In unserem Fall wird dieser Aspekt durch eine theoriegeleitete Konstruktion des Kompetenzmodells abgesichert. Das genutzte Modell ist bereits etabliert und wurde in verschiedenen Tests erfolgreich eingesetzt (Mayer, 2007). Die einzelnen Aufgaben werden ergänzend durch Expertenratings beurteilt, die unter anderem die Übereinstimmung von Kompetenzmodell und Items absichern sollten (siehe auch Schmiemann & Lücken, 2014). Die Validität innerhalb der Testitems wird zusätzlich durch die Konstruktion auf Grundlage von offenen Aufgaben unterstützt (Sadler, 1998). Die Inhaltsvalidität wird auch post-hoc durch den Einsatz von Think-aloud-studien überprüft (Schmiemann & Lücken, 2014). Bei Kompetenztests ist hierbei vor allem auf die kognitiven Aspekte im Sinne der Kompetenz zu achten. Es bedarf also “evidence that the tasks evoke the kinds of thinking and reasoning that are part of the inference on which a judgment of competence is made“ (Shavelson, 2013, S. 36). Die Physikaufgaben aus dem Bereich der Untersuchungen werden in einer Begleitstudie durch Think-aloud-Studien evaluiert (Klemm, in Vorbereitung). Die Kriteriumsvalidität „bezieht sich auf den Zusammenhang zwischen den empirisch gemessenen Ergebnissen des Messinstruments und einem anders gemessenen empirischen („externen“) Kriterium.“ (Schnell et al., 2011, S. 147). Unterschieden wird eine prädiktive und eine konkurrierende Validität (Schmiemann & Lücken, 2014). Hartmann, Upmeier zu Belzen, Krüger und Pant (2015) untersuchen die konkurrierende Validität dieses Testinstruments im Sinne einer Known-Group-Validity. Dabei stellten sich die erwarteten Gruppenunterschiede (z.B. Bachelor-Master) ein. Sie folgern daraus, dass die Ergebnisse die konkurrierende Validität des Instruments stützen (Hartmann & Upmeier zu Belzen et al., 2015). Die prädiktive Validität wurde bislang nicht weiter untersucht. Denkbar wäre, mit Hilfe des Instruments Voraussagen über die Ergebnisse in Experimentalpraktika aufzustellen.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 94 Unter Konstruktvalidität versteht man die Feststellung empirisch abgesicherter Zusammenhänge mit anderen Konstrukten, die vorher theoretisch vorhergesagt wurden (Schnell et al., 2011, S. 148). Denkbar ist hier eine konvergente Validierung mit anderen Instrumenten, die ebenfalls Aspekte naturwissenschaftlicher Erkenntnisgewinnung messen sollen. Dazu wird ein Teilsample der Items aus der Physik mit einem Fragebogen zur Erhebung der Qualität in Experimentalpraktika (Rehfeldt, Mühlenbruch & Nordmeier, 2015) abgeglichen. Erwartet wird hier eine positive Korrelation zwischen dem Kompetenzzuwachs, welcher durch den hier beschriebenen Kompetenztest gemessen wird und dem selbsteingeschätzten Kompetenzzuwachs, welcher durch den Fragebogen erhoben wird (Rehfeldt, Straube, Stiller, Kratschmar & Nordmeier, in Vorbereitung). Daneben wurde ebenfalls eine diskriminante Validierung (Schmiemann & Lücken, 2014) durchgeführt. Dazu wurden die kognitiven Grundfähigkeiten einer Teilstichprobe mit einem Intelligenz-Struktur-Test (Liepmann, Beauducel, Brocke & Nettelnstroth, 2012) erhoben. Dadurch soll sichergestellt werden, dass der Test etwas anderes als kognitive Grundfähigkeiten misst (vgl. Schmiemann & Lücken, 2014).
Auswertung 95 7. Auswertung Im Rahmen dieser Arbeit wurde auf Grundlage von theoretischen Überlegungen ein Kompetenzstrukturmodell für den Bereich der Naturwissenschaftlichen Erkenntnisgewinnung entwickelt (siehe Kapitel 2 und 3). Die zentralen Forschungsfragen wurden bezüglich der Dimensionierung dieser Kompetenz und zum Kompetenzstand Studierender aufgestellt (siehe Kapitel 4). Da zum Zeitpunkt der Studie kein deutschsprachiges Testinstrument zur Erfassung der Erkenntnisgewinnungskompetenz zur Verfügung stand, wurde ein Kompetenztest entwickelt (siehe Kapitel 6). Die Testgüte wurde durch verschiedene Schritte im Verlauf der Testkonstruktion und durch Post-Hoc-Analysen abgesichert und überprüft (siehe Abschnitt 6.3.1). In diesem Kapitel folgt nun mit Hilfe der oben beschriebenen Methoden (siehe Abschnitt 5.2) die Bearbeitung der oben beschriebenen Fragestellungen und Hypothesen (siehe Kapitel 4). Zur RASCH-Modellierung wurde die Software ACER Conquest 3.0 (Adams et al., 2012) genutzt. Weitere statistische Berechnungen wurden mit IBM® SPSS 22® (IBM Corp., 2013) durchgeführt. Für die Berechnung von Effektstärken und Test-Stärken wurde G*Power 3.1 (Faul, Erdfelder, Lang & Buchner, 2007) genutzt. Die Erstellung von Diagrammen und sonstige Berechnungen erfolgten mit Microsoft® Excel 2010® (Microsoft, 2010). 7.1 Beschreibung der Stichprobe Die Normierungsstichprobe bestand aus 2651 Studierenden der Biologie, Chemie und Physik (sowohl Lehramtsstudierende als auch Fachstudierende). Daraus wurden fünf Proband/inn/en entfernt, weil für sie bei weniger als drei Items gültige Antworten vorlagen. Damit blieben 2646 Studierende. Sie stammen zu 43,0% von der Freien Universität Berlin und zu 27,2% von der Humboldt Universität zu Berlin. Weitere 19,2% stammen aus Österreich von den Universitäten in Wien, Salzburg und Innsbruck. Die restlichen Proband/inn/en stammen von verschiedenen Universitäten aus Deutschland (z. B. Hannover, Potsdam, Aachen). Weiblich sind 53,8 % der Proband/inn/en, das Durchschnittsalter beträgt 22,7 Jahre (SD=4,5). In einem Lehramtsstudium waren 52,5% der Studierenden immatrikuliert. Die Verteilung über die Fächer sieht folgendermaßen aus:
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 96 Tabelle 13: Verteilung der Proband/inn/en der Normierungsstichprobe nach Fächern Fach Physik Biologie Chemie N 695 (26,3 %) 1663 (62,8 %) 552 (20,9 %) Durch die Möglichkeit, zwei Fächer kombiniert zu studieren, sind in Tabelle 13 Doppelnennungen enthalten. Daher ergibt sich dort eine Gesamtsumme, die höher ist als die Zahl der Proband/inn/en. Die in dieser Studie fokussierte Gruppe der Physikstudierenden ist im Durchschnitt 23,1 Jahre (SD = 5,0) alt (Fach: 22,1 (4,9) Jahre; Lehramt: 24,1 (5,0) Jahre). In der Gruppe befinden sich 179 weibliche Studierende (25,8 %). Ein Lehramtsstudium absolvieren 342 Studierende (49,2 %). Ein Lehramtsstudium Physik zusammen mit Biologie oder Chemie studieren 64 Studierende (9,2 %). Die Verteilung über die Universitäten sieht folgendermaßen aus: Tabelle 14: Verteilung der Proband/inn/en der Normierungsstichprobe nach Universitäten Universität N % Freie Universität Berlin 296 42,6 Humboldt Universität zu Berlin 203 29,2 Universität Wien/Innsbruck 77 11,0 Sonstige (Deutschland)* 81 11,6 Fehlend** 38 5,5 * andere Universitäten in Deutschland ** keine Angaben zur Universität im Testheft
Auswertung 97 7.2 Fragestellung 1: Dimensionierung des Kompetenzstrukturmodells Zunächst wird der Fragestellung nachgegangen, inwiefern man die theoretisch plausible Dimensionierung des Kompetenzstrukturmodells nach Arbeitsweisen und die nicht plausible Dimensionierung nach Fächern in den empirisch erhobenen Daten wiederfinden kann. FF1: Welches Modell beschreibt die Daten am besten? Zur Beantwortung dieser Fragestellung werden entsprechend der untenstehenden Hypothesen verschiedene einund mehrdimensionale RASCH-Modelle spezifiziert. Für die berechneten Modelle werden die Deviance-Statistik sowie die Freiheitsgerade angegeben. Aus diesen beiden Größen werden die Informationskriterien CAIC und BIC sowie der 𝜒𝜒2 -Test berechnet (vgl. Abschnitt 5.2.5) und pro Hypothese tabellarisch dargestellt. H1a: Ein eindimensionales Modell beschreibt die Daten besser als ein Modell, das nach Fächern differenziert. Der vorliegende Kompetenztest soll auf die schwachen, fächerübergreifenden Methoden der naturwissenschaftlichen Erkenntnisgewinnung fokussieren. Sofern der Fachinhalt bekannt ist, sollte es daher für die Proband/inn/en keinen Unterschied machen, ob sie Aufgaben einer anderen Naturwissenschaft als der Physik bearbeiten (vgl. Giere et al., 2006; Klahr, 2000). Es werden daher drei Modelle getestet: 1A: eindimensionales Modell 1B: zweidimensionales Modell Physik vs. Biologie & Chemie 1C: dreidimensionales Modell Physik, Biologie, Chemie Tabelle 15: Prüfung der Modellpassung Hypothese H1a Modell Deviance [ −𝟐𝟐𝐥𝐥𝐥𝐥(𝑳𝑳) ] 𝒇𝒇 CAIC BIC 𝝌𝝌𝟐𝟐 (gegen 1D) 1A (1D) 14738 125 15680,99 15.555,99 - 1B (2D) 14735 128 15700,62 15572,62 0,39 1C (3D) 14735 132 15730,80 15598,80 0,86
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 98 Die Informationskriterien CAIC und BIC sind jeweils für das eindimensionale Modell am niedrigsten und deuten daher auf eine bessere Passung des eindimensionalen Modells hin. Der 𝜒𝜒2-Test zeigt ebenfalls keinen signifikanten Vorteil für die mehrdimensionalen Modelle an. Die Hypothese H1a wird damit gestützt. H1b: Ein In Bezug auf die Arbeitsweisen Untersuchungen und Modelle nutzen zweidimensionales Modell beschreibt die Daten besser als ein eindimensionales Modell. Auch wenn die oben genannten vorläufigen Ergebnisse auf eine eindimensionale Struktur des Modells hindeuten, die sich auch nach den Arbeitsweisen nicht unterscheiden lässt, so gibt es doch theoretische Gründe (siehe Kapitel 4), die für eine mehrdimensionale Struktur sprechen. Es werden folgende Modelle getestet: 2A: eindimensionales Modell 2B: zweidimensionales Modell nach Arbeitsweisen (Untersuchungen & Modelle Nutzen) 2C: siebendimensionales Modell nach Kompetenzfacetten Tabelle 16: Prüfung der Modellpassung Hypothese H1b Modell Deviance [ −𝟐𝟐𝐥𝐥𝐥𝐥(𝑳𝑳) ] 𝒇𝒇 CAIC BIC 𝝌𝝌𝟐𝟐 (gegen 1D) 2A (1D) 14738 125 15680,99 15.555,99 - 2B (2D) 14741 128 15706,62 15578,62 0,39 2C (7D) 14679 158 15870,94 15712,94 <0,01 Der 𝜒𝜒2-Test wird für das siebendimensionale Modell signifikant, allerdings zeigen die Informationskriterien CAIC und BIC jeweils eine bessere Passung des eindimensionalen Modells an. Die Hypothese H1b muss daher verworfen werden.
Auswertung 99 H1c: Ein eindimensionales Modell beschreibt die Daten besser als ein mehrdimensionales Modell, welches nach Fächern und Arbeitsweisen unterscheidet. Aus theoretischer Sicht ist aus den oben dargestellten Gründen (siehe Kapitel 4) auch eine Unterscheidung nach Fächern und Arbeitsweisen denkbar. Allerdings sprechen die beiden zuvor getesteten Hypothesen gegen diese Vermutung. Um diese Hypothese trotzdem getestet zu haben, werden folgende Modelle miteinander verglichen: 3A: eindimensionales Modell 3B: vierdimensionales Modell nach Fächern (Physik vs. Biologie & Chemie) und Arbeitsweisen (Untersuchungen und Modelle nutzen) 3C: sechsdimensionales Modell nach Fächern und Arbeitsweisen Tabelle 17: Prüfung der Modellpassung Hypothese H1c Modell Deviance [ −𝟐𝟐𝐥𝐥𝐥𝐥(𝑳𝑳) ] 𝒇𝒇 CAIC BIC 𝝌𝝌𝟐𝟐 (gegen 1D) 3A (1D) 14738 125 15680,99 15.555,99 - 3B (4D) 14734 137 15767,91 15630,91 0,98 3C (6D) 14708 150 15839,59 15689,59 0,22 Die Informationskriterien CAIC und BIC deuten auf eine bessere Passung des eindimensionalen Modells hin. Der 𝜒𝜒2-Test zeigt ebenfalls keinen signifikanten Vorteil für die mehrdimensionalen Modelle an. Die Hypothese H1c wird damit gestützt.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 106 Tabelle 21: Unstandardisierte Regressionsgewichte (in Logits) des Hintergrundmodells Fragestellungen 2 bis 5 Prädiktorvariable B SE(B) Constant 0,173* 0,069 Bachelor 2 (BA2) 0,097 0,095 Master 0,502*** 0,113 Lehramt (1=Lehramt) -0,386** 0,130 Lehramt x Bachelor 2 0,233 0,158 Lehramt x Master 0,110 0,174 Geschlecht (1=weiblich) -0,187** 0,070 *p<,05; **p<,01; ***p<,001 Innerhalb des latenten Regressionsmodells deuten sich schon bestimmte Effekte an. So zeigen die Prädiktorvariablen Master, Lehramt und weiblich signifikante Effekte an. Zur Beantwortung der Fragestellungen 2-5 wird eine faktorielle ANOVA mit den Faktoren Studienphase, Lehramt und weiblich berechnet. Für diese Modellierung werden fünf PVs pro Fall exportiert und in fünf einzelne ANOVAs importiert. Zunächst werden die Voraussetzungen für die ANOVA geprüft. Für alle sechs Gruppen und für alle fünf PVs wird die Normalverteilung mit dem K-S-Test und dem S-W-Test geprüft, außerdem werden Schiefe und Kurtosis berechnet. Für PV1 zeigt der S-W-Test für zwei Subgruppen signifikante Abweichungen von der Normalverteilung an. Diese treten aber in den Gruppen auf, die hohe Proband/inn/enzahlen aufweisen. Dadurch werden auch schon kleine Abweichungen signifikant (Field, 2009). Die weiteren Subgruppen sind aber unauffällig und zeigen keine signifikanten Abweichungen von der Normalverteilung an. Insbesondere bleibt der K-S-Test durchgängig ohne signifikantes Ergebnis. Da für den übergroßen Anteil der Subgruppen keine Verletzung der Normalverteilung angezeigt wird, die Abweichung auch nur durch den grundsätzlich konservativeren S-W-Test (Field, 2009, S. 148) erkannt wird und die ANOVA generell auch als robust gegenüber einer derartigen Verletzung gilt (Bühner & Ziegler, 2009, S. 368), wird die ANOVA als Testverfahren beibehalten. Der Levene-Test zur Überprüfung der Varianzgleichheit zeigt keine Verletzung der Varianzhomogenität für alle fünf PVs an (FPV1(11,670) = 1,189 ,n.s. ; FPV2(11,670) = 1,199 , n.s. ; FPV3(11,670) = 0,868 , n.s. ; FPV4(11,670) = 1,118 ,n.s. ; FPV5(11,670) = 0,346, n.s.)
Auswertung 107 Die hier dargestellten Ergebnisse sind durch Kombination der Teststatistiken (siehe Abschnitt 5.2.3) aus den Ergebnissen von fünf ANOVAs für jeden einzelnen PV entstanden. Aus den gemittelten Quadratsummen wurden F-Werte errechnet (siehe Abschnitt 5.2.7). Die einzelnen ANOVAs sind im Anhang aufgeführt. Die Signifikanz wurde durch Abgleich mit kritischen F-Werten ermittelt (Backhaus, Erichson, Plinke & Weiber, 2000). Die Effektstärken wurden aus den Quadratsummen ermittelt (siehe Abschnitt 5.2.9). Tabelle 22: Kombinierte ANOVA Fragestellungen 2 bis 5 Abhängige Variable: PV1, PV2, PV3, PV4, PV5 (kombiniert) Quelle Typ III Quadratsumme df Quadratischer Mittelwert F Sig. ɳP² r Korrigiertes Modell 37,341 6 6,224 21,594 <0,001 0,161 0,4 Konstanter Term 8,733 1 8,733 30,301 <0,001 0,043 0,21 Studienphase 26,878 2 13,439 46,63 <0,001 0,121 0,35 Lehramt 8,106 1 8,106 28,126 <0,001 0,040 0,2 Weiblich 4,825 1 4,825 16,741 <0,001 0,024 0,15 Studienphase * Lehramt 1,551 2 0,776 2,691 >0,05 0,008 0,09 Fehler 194,540 675 0,288 Gesamtsumme 255,513 682 Korrigierter Gesamtwert 231,881 681
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 108 Tabelle 23: Kombinierte Deskriptive Statistik Fragestellungen 2 bis 5 M SD² Messvarianz Fehlervarianz SD gesamt N SE BA1 Gesamt 0,0257 0,3083 0,0001 0,3084 0,5553 187 0,0406 BA2 Gesamt 0,1125 0,3068 0,0001 0,3069 0,554 308 0,0316 Master Gesamt 0,4676 0,3168 0,0009 0,3179 0,5638 187 0,0412 BA 1 Fach 0,1266 0,2811 0,0001 0,2812 0,5303 135 0,0456 BA 2 Fach 0,1984 0,3198 0,0003 0,3202 0,5659 135 0,0487 MA Fach 0,6542 0,3005 0,0017 0,3025 0,55 73 0,0644 BA 1 LA -0,2361 0,2866 0,0029 0,2901 0,5386 52 0,0747 BA 2 LA 0,0454 0,2879 0,0002 0,2881 0,5367 173 0,0408 MA LA 0,3481 0,2928 0,0007 0,2936 0,5418 114 0,0507 Fach 0,2698 0,3348 0,0001 0,3349 0,5787 343 0,0312 LA 0,1014 0,3234 0,0002 0,3236 0,5689 339 0,0309 nicht weiblich 0,2431 0,3291 0,0288 0,3637 0,6031 504 0,0269 weiblich 0,0631 0,3375 0,0094 0,3488 0,5906 178 0,0443 Ausgehend von dieser ANOVA können nun die Fragestellungen 2-5 bearbeitet werden: FF2: Existieren Unterschiede im Kompetenzstand zwischen Lehramtsstudierenden der Physik und Fachstudierenden der Physik? H2: Lehramtsstudierende weisen einen geringeren Kompetenzstand als Fachstudierende der Physik auf. (sig. (Lehramt)<0,05). Die ANOVA zeigt signifikante Unterschiede zwischen Lehramtsstudierenden und Fachstudierenden der Physik F(1,675) = 28,126, p < 0,001, ɳP² = 0,040, r = 0,20. Die Hypothese H2 wird daher gestützt.
Auswertung 109 Abbildung 17: Kompetenzstand Fachund Lehramtsstudierender (Fragestellung 2) FF3: Existieren Unterschiede im Kompetenzstand Studierender im Bereich der Erkenntnisgewinnung zu verschiedenen Phasen im Studienverlauf? H3: Der mittlere Kompetenzstand der Studierenden der Physik ist höher, je weiter fortgeschritten die Studierenden im Studium sind (p < 0,05). Abbildung 18: Kompetenzstand Studierende zu verschiedenen Phasen des Studiums (Fragestellung 3) -0,4 -0,2 0 0,2 0,4 0,6 0,8 Fach Lehramt PV Gesamt [Logits] Studienart Fehlerbalken: +/- 2 SE -0,4 -0,2 0 0,2 0,4 0,6 0,8 BA1 Gesamt BA2 Gesamt Master Gesamt PV Gesamt [Logits] Studienphase Fehlerbalken: +/- 2 SE
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 110 Die ANOVA zeigt für die Variable Studienverlauf eine signifikante Veränderung über den Studienverlauf an F(2,675) = 46,630, p < 0,001 , ɳP² = 0,121 , r = 0,35. Unterschiede zwischen den drei Gruppen werden mit zwei T-Tests (siehe Abschnitt 5.2.7) genauer untersucht32 . Tabelle 24: T-Test: Bachelor Phase 1 gegen Bachelor Phase 2 Gruppe N M SD df t p (1-seitig) d r Bachelor 1 187 0,0257 0,5553 493 -1,69 0,045 0,156 0.08 Bachelor 2 308 0,1125 0,554 Der T-Test zwischen den Gruppen zeigt keinen signifikanten Unterschied zwischen den Gruppen Bachelor 1 und Bachelor 2 (Senkung des Signifikanzniveaus auf p < 0,025). Eine Teststärke von 1−𝛽𝛽 ≥0,80 wird für Effektstärken von 𝑑𝑑 ≥0,23 erreicht. Tabelle 25: T-Test: Bachelor Phase 2 gegen Master Gruppe N M SD df t p (1-seitig) d r Bachelor 2 308 0,1125 0,554 493 -6,87 <0,01 0,636 0.30 Master 187 0,4676 0,5638 Der T-Test zwischen den Gruppen Bachelor 2 und Master zeigt einen signifikanten Unterschied zwischen den Gruppen. Die Ergebnisse stützen die Hypothese H3 für die Differenz im Kompetenzstand zwischen den Phasen Bachelor 2 und Master. 32 Berechnet mit SPSS 22, nach der Methode von Field (2009, S. 336). Senkung des Signifikanzniveaus auf p<0,025 nach Bonferoni (Field (2009, S. 373)
Auswertung 111 FF4: Existieren Unterschiede in den Differenzen im Kompetenzstand zwischen Lehramtsstudierenden der Physik und Fachstudierenden zu den unterschiedlichen Phasen des Studiums? H4: Es existieren keine Unterschiede in den Differenzen im Kompetenzstand zwischen Lehramtsstudierenden der Physik und Fachstudierenden zu den unterschiedlichen Phasen des Studiums (sig. (Lehramt*Studienphase) > 0,05; 𝟏𝟏−𝜷𝜷 ≥ 𝟎𝟎,𝟗𝟗𝟎𝟎) Die ANOVA zeigt für die Interaktion Lehramt*Studienphase keine signifikanten Unterschiede an F(2, 675) = 2,691, p > 0,05, ɳP² = 0,008. Die Teststärke (Power) erreicht Werte von 1−𝛽𝛽 ≥0,9 bei Effektstärken von ɳP² = 0,017. Die Hypothese H4 wird demnach für starke und mittlere Effekte gestützt. Auf Abbildung 19 ist der Kompetenzstand zu den drei erhobenen Phasen des Studiums für Fachund Lehramtsstudierende geplottet. Es zeigt sich ein Zuwachs über die Semester, der weitestgehend synchron verläuft, auch wenn der Unterschied im Kompetenzstand in der zweiten Phase des Bachelors deutlich abnimmt. In der Masterphase des Studiums ist diese Differenz im Kompetenzstand wieder ablesbar. Abbildung 19: Kompetenzstand Lehramtsund Fachstudierender zu verschiedenen Phasen des Studiums (Fragestellung 4) -0,4 -0,2 0 0,2 0,4 0,6 0,8 BA1 BA2 Master PV Gesamt [Logits] Studienphase Fehlerbalken: +/- 2 SE Fach Lehramt
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 112 FF5: Existieren Unterschiede im Kompetenzstand von weiblichen und männlichen Studierenden? H5: Weibliche Studierende zeigen den gleichen Kompetenzstand wie männliche Studierende (p > 0,05; 𝟏𝟏−𝜷𝜷≥𝟎𝟎,𝟗𝟗𝟎𝟎).33 Die ANOVA zeigt signifikante Unterschiede zwischen weiblichen und nicht weiblichen Studierenden, F(1,675) = 16,741, p < 0,001, ɳP² = 0,024, r = 0,15, zu Gunsten der nicht weiblichen Studierenden an. Auf eine Power-Analyse kann aufgrund des signifikanten Ergebnisses verzichtet werden. Die Hypothese H5 muss daher verworfen werden. Abbildung 20: Kompetenzstand nichtweiblicher und weiblicher Studierender (Fragestellung 5) 33 Bei der Prüfung dieser Hypothese wird nicht zwischen Fachund Lehramtsstudierenden unterschieden. -0,4 -0,2 0 0,2 0,4 0,6 0,8 nicht weiblich weiblich PV Gesamt [Logits] Geschlecht Fehlerbalken: +/- 2 SE
Auswertung 113 FF6: Gibt es Unterschiede im Kompetenzstand von Lehramtsstudierenden, die neben Physik ein weiteres naturwissenschaftliches Fach studieren im Vergleich zu denen, die kein weiteres naturwissenschaftliches Fach studieren? H6: Studierende mit einem weiteren naturwissenschaftlichen Fach weisen einen höheren Kompetenzstand auf, als Studierende ohne weiteres naturwissenschaftliches Fach (p < 0,05). Zur Beantwortung dieser Fragestellung wird eine erneute RASCH-Modellierung mit latentem Hintergrundmodell vorgenommen. In der Stichprobe werden nur Lehramtsstudierende aufgenommen. Es werden die in der ersten Modellierung signifikanten Prädiktorvariablen BA2, MA und weiblich, sowie als neue Variable Zwei naturwissenschaftliche Fächer aufgenommen. Die Variable Lehramt kann bei dieser Modellierung entfallen. Im latenten Hintergrundmodell der RASCH-Modellierung ergeben sich folgende Regressionsgewichte: Tabelle 26: Unstandardisierte Regressionsgewichte (in Logits) des Hintergrundmodells Prädiktorvariable B SE(B) Constant -0,232* 0,115 Bachelor 2 (BA2) 0,340* 0,124 Master (MA) 0,625*** 0,129 Geschlecht (1=weiblich) -0,209* 0,086 Zwei naw. Fächer (1=2 naw. Fächer) 0,093 0,106 *p<,05; **p<,01; ***p<,001 Die Prädiktorvariable zwei naw. Fächer wird im Hintergrundmodell nicht signifikant (p>0,05). Die Tests auf Abweichung von der Normalverteilung fallen alle nicht signifikant aus (siehe Anhang). Gleiches gilt für die Tests auf Varianzhomogenität (FPV1(1,337) = 0,122 , ns.; FPV2(1,337) = 0,433 , n.s. ; FPV3(1,337) = 1,233 , n.s. ; FPV4(1,337) = 0,440 , n.s. ; FPV5(1,337) = 0,400 , n.s.). Die erhaltenen PVs werden gemittelt und die Standardabweichungen entsprechend korrigiert. Für die beiden betreffenden Gruppen wird ein T-Test gerechnet. Der T-Test fällt nicht signifikant aus. Eine Teststärke von 1−𝛽𝛽 ≥0,80 wird
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 114 für Effektstärken von 𝑑𝑑 ≥0,35 erreicht. Die Hypothese H6 muss daher für mittlere und starke Effekte verworfen werden Tabelle 27: T-Test: Lehramtsstudierende der Physik gegen Lehramtsstudierende der Physik mit einem weiterem naturwissenschaftlichen Fach Gruppe N M SD df t p (1-seitig) r Nur Physik 278 0,076 0,5553 337 -0,04 0,49 0.00 Physik + 2. Nawi Fach 61 0,0793 0,5587 Abbildung 21: Kompetenzstand Lehramtsstudierender der Physik und Lehramtsstudierende der Physik mit einem weiteren naturwissenschaftlichen Fach (Fragestellung 6) -0,4 -0,2 0 0,2 0,4 0,6 0,8 nur Physik Physik und ein weiteres naturwissenschaftliches Fach PV Gesamt [Logits] weitere naturwissenschaftliche Fächer Fehlerbalken: +/- 2 SE
Auswertung 115 7.4 Fragestellungen 7 und 8: Kompetenzstand von Studierenden im Fach „Integrierte Naturwissenschaften“ Die Fragestellungen 7 und 8 betreffen Grundschullehramtsstudierende im Fach „Integrierte Naturwissenschaften“. Zur Beantwortung dieser Fragestellungen wird eine RASCH-Modellierung (siehe Abschnitt 5.2.1) mit den Proband/inn/en, die das Fach Integrierte Naturwissenschaften studieren, vorgenommen. Als Vergleichsgruppe werden die Proband/inn/en, die Physik im ersten Semester studieren, herangezogen. In das Hintergrundmodell (siehe Abschnitt 5.2.4) werden die Prädiktorvariablen Naw1 (Integrierte Naturwissenschaften im 1. Semester) und Naw2 (Integrierte Naturwissenschaften in einem höheren Fachsemester) einbezogen. Die Proband/inn/en verteilen sich wie folgt auf die einzelnen Gruppen: Tabelle 28: Verteilung der Proband/inn/en Studienart PhysikLehramt Int. Nawi. (1.Sem) Int. Nawi. (> 1.Sem) Gesamt N 98 (♀30) 27(♀21) 32(♀26) 157(♀77) Von den Studierenden im Fach Integrierte Naturwissenschaften, die nicht im ersten Fachsemester studieren, befindet sich der Großteil im dritten (33,3 %) und fünften (57,6 %) Semester. Der Rest befindet sich in anderen Bachelorsemestern. Im Hintergrundmodell ergeben sich folgende Regressionsgewichte: Tabelle 29: Unstandardisierte Regressionsgewichte (in Logits) des Hintergrundmodells Prädiktorvariable B SE(B) Constant 0,095 0,083 weiblich -0,244 0,130 Naw1 -0,260 0,167 Naw2 -0,038 0,160 Die Tests auf Normalverteilung (siehe Anlage) zeigen für die Gruppe Naw2 bei PV2 und für die Gruppe Naw1 bei PV4 eine Verletzung der Annahme der Normalverteilung an.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 122 Die Analyse erreicht αCronbach= 0,572. Die Trennschärfe deckt einen Bereich von r = 0,106 bis r = 0,509 ab. Sechs Items weisen eine Trennschärfe von r < 0,3 auf. Auf eine weitere Prüfung der Hypothese wird aufgrund der geringen Trennschärfe des größten Teils der Items verzichtet. Gründe für das Scheitern dieser Untersuchung werden im Diskussionsteil (siehe Kapitel 9) besprochen.
Interpretation der Ergebnisse 123 8. Interpretation der Ergebnisse Die Untersuchung der Dimensionalität unterteilte sich in drei Hypothesen, die einzeln untersucht wurden. Hypothese H1a fokussierte eine mögliche Dimensionierung nach Fächern. Hierbei zeigte sich, dass sowohl die Informationskriterien, als auch der 𝜒𝜒²-Test für eine eindimensionale Struktur sprechen, die nicht nach Fächern differenziert. Hypothese H1b betraf eine mögliche Differenzierung nach Arbeitsweisen. Hier wurde angenommen, dass sich eine Unterscheidung nach Untersuchungen und Modelle Nutzen auch in der Datenstruktur wieder finden lässt. Die Ergebnisse deuten auch hier insgesamt auf eine bessere Passung eines eindimensionalen Modells hin, auch wenn der 𝜒𝜒²-Test zu Gunsten des siebendimensionalen Modells ausfällt. Diese bessere Passung geht auch mit einer starken Zunahme der Freiheitsgerade einher. Diese Zunahme steht im Missverhältnis zur Zunahme der Modellpassung, was durch die Informationskriterien angezeigt wird. Die Hypothese H1b muss insgesamt abgelehnt werden. Auch hier zeigt sich demnach die beste Passung eines eindimensionalen Modells. Die Hypothese H1c sagte eine bessere Passung eines eindimensionalen Modells gegenüber Modellen voraus, die sowohl nach Fächern als auch nach Arbeitsweisen unterscheiden. Die Informationskriterien, wie auch der 𝜒𝜒²-Test stützen diese Hypothese. Insgesamt deuten alle drei getesteten Hypothesen auf die beste Passung eines eindimensionalen Modells hin. Die Hypothese H2 betraf generelle Unterschiede im Kompetenzstand zwischen Lehramtsstudierenden und Fachstudierenden der Physik. Hier wurde aufgrund der geringeren Eingangsvoraussetzungen von Lehramtsstudierenden angenommen, dass ein Unterschied zwischen beiden Gruppen existiert zu Gunsten der Fachstudierenden. Die ANOVA weist hier auf einen hochsignifikanten Effekt hin. Lehramtsstudierende weisen demnach einen geringeren Kompetenzstand auf als Fachstudierende der Physik. Dabei handelt es sich um einen schwachen bis mittleren Effekt (ɳP² = 0,040). Die Hypothese H3 betraf Unterschiede im Kompetenzstand der Erkenntnisgewinnung zu verschiedenen Phasen des Physikstudiums. Hierbei wurde zunächst noch nicht zwischen Lehramtsstudierenden und Fachstudierenden unterschieden. Die ANOVA zeigt einen signifikanten Einfluss der Studienphase auf den Kompetenzstand an. Zwei T-Tests als Paarvergleiche deuten auf einen nicht signifikanten Unterschied der Kompetenz von Studienphase Bachelor 1 zu Studienphase Bachelor 2 und einen hochsignifikanten Unterschied von Bachelor 2 zum Master hin. Entsprechend wird auch im latenten Hintergrundmodell
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 124 die Variable Ba2 nicht signifikant. Die Effektstärke zwischen Bachelor 2 und Master weist mit d = 0,636 auf einen mittleren Effekt hin. Die Hypothese H4 betraf Unterschiede in den Differenzen im Kompetenzstand zu verschiedenen Phasen des Studiums von Lehramtsstudierenden und Fachstudierende der Physik. Es wurde kein Unterschied angenommen, was durch die nicht signifikanten Interaktionseffekte im latenten Hintergrundmodell Lehramt x BA2 und Lehramt x Master sowie durch den nicht signifikanten Interaktionseffekt in der ANOVA Studienphase*Lehramt (p > 0,05) gestützt wird. Die Power-Analyse zeigt, dass für mittlere bis große Effekte die Teststärke ausreicht um Fehler zweiter Art auszuschließen. Dieses Ergebnis unterstreicht ebenfalls die Hypothese. Allerdings reicht die Teststärke nicht aus, um auch kleinere bis mittlere Effekt auszuschließen. Die Hypothese muss daher differenziert beantwortet werden. So sind zumindest keine mittleren und großen Effekte beim Unterschied in den Differenzen im Kompetenzstand zu verschiedenen Phasen des Studiums zu erwarten, jedoch bleibt eine Unsicherheit, dass doch kleine Effekte existieren. Die Hypothese H5 fokussierte auf mögliche Unterschiede im Kompetenzstand von weiblichen und männlichen Studierenden der Physik. Aufgrund der uneindeutigen Forschungslage wurde erwartet, dass beide Gruppen sich im Kompetenzstand nicht unterscheiden. Die ANOVA fällt im Gegensatz zur Erwartung aber signifikant aus. Die errechnete Effektstärke deutet auf einen kleinen Effekt zu Gunsten der männlichen Studierenden hin (ɳP² = 0,024). Die Hypothese H6 sagte positive Effekte des Studiums eines weiteren naturwissenschaftlichen Faches voraus. So wurde angenommen, dass Studierenden mit zwei naturwissenschaftlichen Fächern einen signifikant höheren Kompetenzstand aufweisen, als Studierende die nur Physik studieren. Der T-Test fiel nicht signifikant aus, die Hypothese H6 muss daher abgelehnt werden. Die siebte und achte Fragestellung betrafen den Kompetenzstand von Studierenden der Grundschulpädagogik mit dem Nebenfach Integrierte Naturwissenschaften. Zunächst wurde die Hypothese H7 aufgestellt, dass die Studierenden mit einem zu Physiklehramtsstudierenden vergleichbaren Kompetenzstand das Studium beginnen. Der direkte Vergleich der beiden Gruppen zeigt starke Effekte zu Ungunsten der Studierenden der Integrierten Naturwissenschaften. Eine genauere Analyse der Regressionsgewichte zeigt jedoch keinen signifikanten Effekt. Die Unterschiede zwischen beiden Gruppen sind dem-
Interpretation der Ergebnisse 125 nach nicht alleine durch die Zugehörigkeit zum Studienfach integrierte Naturwissenschaften zu erklären. Die weitere Hypothese H8 betraf die Unterschiede im Kompetenzstand von Studierenden in höheren Fachsemestern im Vergleich zu Studierenden im ersten Semester im Rahmen des Studiums der Integrierten Naturwissenschaften. Hier wurde angenommen, dass aufgrund des Studiums Studierende höherer Fachsemester einen höheren Kompetenzstand aufweisen. Der T-Test zwischen beiden untersuchten Gruppen fällt signifikant aus. Die Hypothese H8 kann demnach mit den hier vorliegenden Daten gestützt werden. Die Hypothese H9 sagte einen höheren Kompetenzstand von Naturwissenschaftsstudierenden gegenüber Studierenden der Sozialkunde voraus. Die Prüfung dieser Hypothese wurde aufgrund des stark dezimierten Aufgabenpools und der geringen Trennschärfe der verbliebenen Items nicht durchgeführt.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 126
Diskussion 127 9. Diskussion Innerhalb dieser Arbeit wurden Items mit physikalischem Kontext für die Erfassung der Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung bei Studierenden entwickelt. Es wurden bestehende Kompetenzmodelle adaptiert, auf deren Grundlage dann Items entwickelt und pilotiert wurden. Der Kompetenztest fokussiert vor allem auf die fächerübergreifenden Aspekte der naturwissenschaftlichen Denkund Arbeitsweisen. Einschränkend könnte argumentiert werden, dass er damit auf den kleinsten gemeinsamen Nenner der drei Fächer Biologie, Chemie und Physik fokussiert. Kritisch könnte zudem angemerkt werden, dass Forschung generell nicht so abläuft, wie sie durch das Kompetenzmodell paradigmatisch beschrieben wird. Beiden Kritikpunkten kann durchaus zugestimmt werden. Es ist aber gerade die Stärke dieses Tests, die Gemeinsamkeiten der drei Naturwissenschaften zu betonen. Insbesondere unter besonderer Berücksichtigung integrativer naturwissenschaftlicher Fächer ist dies ein Vorteil. Für die einzelnen Fächer können nun aufbauend auf diesem Test weitere Instrumente entwickelt werden, die die Besonderheiten der Fächer berücksichtigen. Der zweite Punkt ist durchaus kritischer zu sehen. Jedoch ist hier zu entgegnen, dass selbst wenn Wissenschaftlerinnen und Wissenschaftler nicht konkret so arbeiten, der dargestellte Forschungsablauf dennoch der grobe theoretische Unterbau ist, der implizit ihrer Forschung zu Grunde liegt. Schon Klahr (2000, S. 12f.), auf dessen Arbeiten das hier beschriebene Kompetenzmodell aufbaut, betont, dass ein erfolgreicher Forschender viel mehr wissen muss, als durch das Modell dargestellt wird. Das Modell berücksichtigt lediglich die mentalen Prozesse, die dem wissenschaftlichen Denken zu Grunde liegen. Diese sind domänenübergreifend. Ein/e Physiker/in ist nicht automatisch auch ein/e Chemiker/in oder Biologe/-in, aber „[…]they all use the same weak methods to help solve their respective problems. When their activity is described as search in a problem space, each can understand the rationale of the other's activity[…]” (Klahr & Simon, 2001, S. 78). Wendet man den weiter oben definierten Begriff des Modells auf das Kompetenzmodell an, so wird deutlich, dass eben auch in diesem Modell nur bestimmte Dinge berücksichtigt und andere weggelassen wurden. Trotzdem bleibt das Kompetenzmodell ein Modell für die reale Forschungstätigkeit von Wissenschaftlerinnen und Wissenschaftlern. Wie jedes Modell ist es eine Annäherung an die Wirklichkeit, es bleibt aber unvollständig. So bleiben einige Eigenheiten der Physik innerhalb des Modells unberührt. Dazu zählen unter anderem das Problem der Nebenhypothesen (Duhem-Quine-These), der Umgang mit Wahrscheinlichkeitshypothesen, der
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 128 praktische Umgang mit Experimenten und Geräten sowie Aspekte der Nature of Science. Letztere fallen beide aber ohnehin unter andere Aspekte der naturwissenschaftlichen Erkenntnisgewinnung (Mayer, 2007). Dies ist demnach nicht unbedingt als Mangel des vorliegenden Tests anzusehen sondern vielmehr als Forschungsdesiderat. Im Rahmen der Aufgabenentwicklung wurden bereits bewährte Methoden und Verfahrensweisen wie eine Entwicklung entlang eines Manuals und regelmäßige Expertenratings eingesetzt. Als sehr erfolgreich kann außerdem die Konstruktion der MC-Antwortoption auf Grundlage von echten Studierendenantworten gesehen werden. Zum einen ersparen diese Zeit, weil diese schon vorliegen, zum anderen kommen die oben erwähnten Vorteile wie eine höhere Authentizität zum Tragen. Nach Abschluss verschiedener Pilotierungsrunden konnten daher 20 Testhefte mit insgesamt 123 Items erstellt und eingesetzt werden. Die erste Fragestellung betraf die Dimensionierung des Kompetenzstrukturmodells. Hier wurden verschiedene, aus der Theorie begründete, mehrdimensionale Modelle getestet. Es zeigte sich aber jeweils, dass die Evidenz für ein eindimensionales Modell am größten ist. So sprechen die Ergebnisse für die bessere Passung eines eindimensionalen Modells im Vergleich zu einem, das nach Fächern unterscheidet. Dies entspricht den Ergebnissen, die auch schon für die Gesamt- (Hartmann & Mathesius et al., 2015) und Teilstichprobe (Physikund Chemiestudierende) (Stiller et al., 2015) gefunden wurden. Dass das gleiche Ergebnis auch für eine (homogenere) Stichprobe von Physikstudierenden gefunden wurde, unterstreicht diese vorhergenannten Ergebnisse nochmals deutlich. Es entspricht auch den theoretischen Ergebnissen, dass die schwachen wissenschaftlichen Methoden in allen (Natur-)Wissenschaftsdisziplinen (Klahr, 2000) zu finden sind und dass sich Wissenschaftlerinnen und Wissenschaftler unabhängig vom Fachwissen darüber verständigen können (s. o.). Auch für eine Strukturierung nach Kompetenzdimensionen ergibt sich keine Evidenz. Dies deckt sich mit den Erkenntnissen von anderen Studien (z.B. Gut-Glanzmann, 2012; Wellnitz, 2012; Woitkowski, 2015). Allerdings gab es auch Studien, die mit einem ähnlichen Kompetenzmodell zu gegenteiligen Ergebnissen kamen: So konnte Grube (2010, S. 57) für den Bereich Experimentieren eine bessere Passung eines vierdimensionalen Modells berichten. Die zitierten Studien fokussieren allerdings immer nur auf eine Fachwissenschaft. Insofern können Vergleiche lediglich Anhaltspunkte bieten. Studien, die eine fächerübergreifende Kompetenzmodellierung in diesem Bereich zum Ziel hatten, sind
Diskussion 129 nicht bekannt. Es bleibt bei dem hier vorliegenden Test allerdings eine gewisse Unsicherheit, dass eine Dimensionierung möglicherweise besteht, diese aber auf Grund der, durch das Multi-Matrix-Design bedingten, geringen Anzahl an Items pro Dimension, nicht nachweisbar ist (vgl. Gonzales & Rutkowski, 2010). Entsprechend der Ergebnisse der ersten beiden Dimensionsprüfungen zeigte auch eine Unterscheidung nach Fächern und Kompetenzdimensionen keine bessere Passung als das eindimensionale Modell. Bei der anschließenden Itemselektion, die auf Grundlage des eindimensionalen Modells geschah, wurden Items entfernt, die eine mangelnde Passung auf das RASCH-Modell oder ein DIF zeigten. Insgesamt wurden dabei aber nur fünf Items entfernt. Der Einfluss auf die inhaltlichen Aspekte des Modells sollte demnach gering sein, weil alle Zellen des Kompetenzmodells weiterhin mit ausreichend Items abgedeckt sind. Für den aktuell im Projekt ValidiS38 weiterverfolgten Längsschnitt wurden aufgrund dieser Ergebnisse Testhefte konstruiert, die nur noch RASCH-konforme Items enthielten. Aufgrund der zeitlichen Einschränkungen des Projekts war dies für diese Studie aber nicht mehr möglich, weshalb die oben genannten fünf Items für die Auswertung entfernt werden mussten. Die in der Auswertung verbleibenden Items zeigen eine zufriedenstellende Passung auf das verwendete RASCH-Modell. Die Reliabilität ist mit RelEAP/PV=0,500 zwar niedrig, und in der Nomenklatur des Cronbachs α (welches als äquivalent angesehen werden kann (Rost, 2004)) als „schlecht“ einzuordnen. Allerdings weisen andere Kompetenztests zur Erkenntnisgewinnung ähnliche Ergebnisse auf (z. B. Woitkowski (2015, S. 191): RelEAP/PV = 0,518; Wellnitz (2012, S. 110): RelEAP/PV = 0,59). Zudem hängt die Stabilität der Messung (und damit die Reliabilität) mit der Anzahl der Items zusammen (vgl. Linacre, 1994), die bedingt durch die Testlänge mit 18 Items kurz ist. Es wird außerdem argumentiert, dass der Nutzen dieses Reliabilitätsmaßes bei den hier genutzten MatrixSamplings ohnehin wenig Aussagekraft hat (Adams, 2005). Bei der Betrachtung des Kompetenzstandes wurden Unterschiede bei Lehramtsstudierenden und Fachstudierenden der Physik nachgewiesen. Im Mittel weisen Fachstudierende einen höheren Kompetenzstand auf. Bei der Betrachtung des Kompetenzstandes zu verschiedenen Phasen des Studiums zeigt sich erwartungsgemäß ein Unterschied im Kompetenzstand zwischen den Phasen Bachelor 2 und Master. Zwischen den Phasen Bachelor 1 38 Validierungsstudie zum wissenschaftlichen Denken im naturwissenschaftlichen Studium
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 130 und Bachelor 2 wird hingegen kein signifikanter Zuwachs angezeigt. Weiterhin konnten keine Interaktionseffekte zwischen den Variablen Studienphase und Lehramt nachgewiesen werden. Interpretiert man diese Ergebnisse im Sinne eines Quasi-Längsschnitts, sprechen diese dafür, dass sich die Entwicklung dieser Kompetenz zwischen Lehramtsstudierenden und Fachstudierenden nicht unterscheidet. Bringt man dieses Ergebnis mit dem Ergebnis aus Fragestellung zwei zusammen, so zeigt sich, dass Lehramtsstudierende mit einem niedrigeren Kompetenzstand das Studium beginnen und es auch mit einem niedrigen Kompetenzstand als Fachstudierende verlassen. Dabei entwickeln sich beide Gruppen aber annährend parallel. Entgegen früherer Argumentationen scheint also kein Unterschied zwischen der impliziten Vermittlung z. B. in Laborpraktika für Fachstudierende und der expliziten Vermittlung dieser Kompetenz in Didaktikveranstaltungen zu bestehen (vgl. Straube & Nordmeier, 2014). Die Ergebnisse deuten vielmehr darauf hin, dass der Kompetenzerwerb gleich gut gelingt, die Differenzen aber aus unterschiedlichen Eingangsvoraussetzungen resultieren. Dies deckt sich mit Ergebnissen von Albrecht (2011, S. 80, 86), der bei Lehramtsstudierenden im Vergleich zu Fachstudierenden feststellte, dass diese weniger häufig Mathematikoder Physikleistungskurse in der Schule besuchten und eine geringere Note in der Hochschulzugangsberechtigung aufwiesen. Es scheint nicht zu gelingen, diese Differenzen innerhalb des Studiums auszugleichen. Aus dieser vorliegenden Studie geht aber nicht hervor, ob ein derartiger Ausgleich überhaupt notwendig ist. Möglicherweise reicht das erreichte Niveau für das Lehramt entsprechend aus. Diese Ergebnisse stehen teilweise im Widerspruch zu den Ergebnissen der Gesamtstichprobe (Hartmann & Mathesius et al., 2015). Hier zeigte sich zwar ebenfalls ein genereller Vorteil für die Fachstudierenden. Bei genauerer Untersuchung wird aber deutlich, dass ein Interaktionseffekt zum Tragen kommt: So haben im Bachelorstudium die Fachstudierenden zwar einen Vorteil, dieser kehrt sich aber im Masterstudium um. Um die Differenzen zu den hier dargestellten Ergebnissen interpretieren zu können, sind fächervergleichende Analysen notwendig. Denkbar wäre z. B. dass Fachstudierende der Physik aufgrund ihres Studiums einen stärkeren Kompetenzzuwachs aufweisen als die Fachstudierenden der anderen Fächer. Genauso wäre es aber auch möglich, dass die Ausbildung im Bereich Erkenntnisgewinnung für Lehramtsstudierende der Physik weniger erfolgreich als in den anderen Fächern ist. Eine weitere Fragestellung betraf mögliche Unterschiede im Kompetenzstand von weiblichen und männlichen Studierenden. Bisherige Forschungsarbeiten zeigten ein heteroge-
Diskussion 131 nes Bild. Allerdings wurden entweder nur Schülerinnen und Schüler untersucht, oder die Untersuchung fokussierte sich nur auf ein Fach. Entsprechend wurde hierbei zunächst die Nullhypothese angenommen. Die Ergebnisse dieser Studie zeigen, dass die Nullhypothese abgelehnt werden muss, also tatsächlich Unterschiede im Kompetenzstand existieren – zu Gunsten der männlichen Studierenden. Die uneinheitliche Forschungslage macht die Interpretation dieses Ergebnisses schwer. Ausgehend von der Annahme, dass Studierende beider Geschlechter sich bewusst für ein derartiges Studium entschieden haben, sollten Selbstbildoder Stereotypeffekte, wie sie zum Beispiel von Hannover und Kessels (2002) beschrieben werden, keinen Einfluss haben. Möglicherweise kommen hierbei auch wieder unterschiedliche Eingangsvoraussetzungen zum Tragen. Riese und Reinhold (2012) diskutieren einen möglichen Einfluss von Effekten des physikalischen Selbstkonzepts, können aber die ebenfalls in ihrem Fachwissenstest vorhandenen Unterschiede nicht erklären. An diesem Punkt sollte weitere Forschung anschließen. Unter anderem könnte in einem mehrdimensionalen Modell nach Fächern untersucht werden, ob die in der Sekundarstufe I nach Fächern variierenden Vorteile (Schroeders et al., 2013) sich auch in der Hochschulausbildung fortsetzen. Generell ist für diese Fragestellungen aber anzumerken, dass das verwendete Modell lediglich 13 % der Varianz aufklären kann. Demnach scheinen weitere Prädiktoren zu existieren, die im Rahmen dieser Studie nicht untersucht wurden. Nur die Lehramtsstudierenden betreffend wurde außerdem untersucht, ob Unterschiede im Kompetenzstand zwischen solchen, die Physik und ein weiteres naturwissenschaftliches Fach studieren und solchen, die Physik und ein anderes, nicht naturwissenschaftliches Fach studieren, existieren. Es wurde die Hypothese aufgestellt, dass auf Grund der höheren Anzahl an Lerngelegenheiten Lehramtsstudierende mit einem weiteren naturwissenschaftlichen Fach einen höheren Kompetenzstand aufweisen. Die Hypothese wird abgelehnt. Der Datensatz offenbart keine Evidenz für einen derartigen Unterschied. Dies deckt sich mit vorhergehenden, vorläufigen Analysen (Straube & Nordmeier, 2014), widerspricht aber Ergebnissen, die für die Gesamtkohorte errechnet wurden (Hartmann & Mathesius et al., 2015)39. Anscheinend haben Lehramtsstudierende der Physik keinen Vorteil von einem weiteren naturwissenschaftlichen Fach. Dies kann auf zwei Weisen interpretiert werden: Entweder nutzen die Studierenden mit zwei naturwissenschaftlichen 39 Es sei angemerkt, dass diese Analyse in die Gruppe der Studierenden mit einem Fach, auch Fachstudierende einbezog, also nicht ausschließlich Lehramtsstudierende
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 138 nalisierung angehender Lehrerinnen und Lehrer sowie frühpädagogischer Fachkräfte. Bad Heilbrunn: Klinkhart. Hartmann, S., Upmeier zu Belzen, A., Krüger, D. & Pant, H. A. (2015). Scientific Reasoning in Higher Education. Zeitschrift für Psychologie, 223 (1), 47–53. Hofstein, A., Navon, O., Kipnis, M. & Mamlok-Naaman, R. (2005). Developing students' ability to ask more and better questions resulting from inquiry-type chemistry laboratories. Journal of Research in Science Teaching, 42 (7), 791–806. Huber, L. (2008). 'Kompetenzen' prüfen? In S. Dany, B. Szczyrba & J. Wildt (Hrsg.), Prüfungen auf die Agenda! Hochschuldidaktische Perspektiven auf Reformen im Prüfungswesen (1. Aufl.). s.l: Bertelsmann W. Verlag. Hunger, E. (1964). Grundbegriffe physikalischen Denkens. Frankfurt a.M.: Hirschgraben Verlag. IBM Corp. (2013) IBM SPSS Statistics for Windows, Version 22.0 [Computer software]. Justi, R. & Gilbert, J. (2003). Teachers' views on the nature of models. International Journal of Science Education, 25 (11), 1369–1386. Kane, M. T. (1992). The Assessment of Professional Competence. Evaluation & the Health Professions, 15 (2), 163–182. Kircher, E. (1995). Studien zur Physikdidaktik. Erkenntnisund wissenschaftstheoretische Grundlagen (IPN, Bd. 145). Kiel: IPN. Kircher, E. & Dittmer, A. (2004). Lehren und Lernen über die Natur der Naturwissenschaften - ein Überblick. In C. Hößle, D. Höttecke & E. Kircher (Hrsg.), Lehren und Lernen über die Natur der Naturwissenschaften (S. 1–22). Baltmannsweiler: Schneider-Verlag Hohengehren. Kirschner, S. (2013). Modellierung und Analyse des Professionswissens von Physiklehrkräften (Studien zum Physikund Chemielernen, Bd. 161). Klahr, D. & Dunbahr, K. (1988). Dual space search during scientific reasoning. Cognitive Science, 12 (1), 1–48. Klahr, D. (2000). Exploring science. The cognition and development of discovery processes. Cambridge, Massachusetts: MIT Press. Klahr, D. & Simon, H. A. (2001). What Have Psychologists (And Others) Discovered about the Process of Scientific Discovery? Current Directions in Psychological Science, 10 (3), 75–79. Verfügbar unter http://www.jstor.org/stable/20182703 Klemm, A. (in Vorbereitung). Evaluierung von Items zur naturwissenschaftlichen Erkenntnisgewinnung [Arbeitstitel]. Masterarbeit, Freie Universität Berlin. Berlin. Klieme, E. & Hartig, J. (2008). Kompetenzkonzepte in den Sozialwissenschaften und im erziehungswissenschaftlichen Diskurs. In M. Prenzel, I. Gogolin & H. Krüger (Hrsg.), Kompetenzdiagnostik: Zeitschrift für Erziehungswissenschaft. Sonderheft 8 2007 (S. 11–29). VS Verlag fur Sozialwissenschaften GmbH. Zugriff am 15.12.2014. Zugriff am 15.12.2014.
Literaturverzeichnis 139 Klieme, E. & Leutner, D. (2006). Kompetenzmodelle zur Erfassung individueller Lernergebnisse und zur Bilanzierung von Bildungsprozessen. Überarbeitete Fassung des Antrags an die DFG auf Einrichtung eines Schwerpunktprogramms. Zugriff am 30.08.2013. Verfügbar unter http://kompetenzmodelle.dipf.de/pdf/rahmenantrag Klieme, E., Maag-Merki, K. & Hartig, J. (2007). Kompetenzbegriff und Bedeutung von Kompetenzen im Bildungswesen. In J. Hartig & E. Klieme (Hrsg.), Möglichkeiten und Voraussetzungen technologiebasierter Kompetenzdiagnostik. Eine Expertise im Auftrag des Bundesministeriums für Bildung und Forschung (Bildungsforschung, Bd. 20, S. 5–15). Bonn: BMBF. Klos, S., Henke, C., Kieren, C., Walpulski, M. & Sumfleth, E. (2008). Naturwissenschaftliches Experimentieren und chemisches Fachwissen – zwei verschiedene Kompetenzen. Zeittschrift für Pädagogik, 54 (3), 304–312. Köller, O. (2014). Naturwissenschaftliche Leistungen, demographische Veränderungen und Lehrerbildung. Zeitschrift für Didaktik der Naturwissenschaften, 20 (1), 3–9. Konferenz der europäischen Hochschulministerinnen und -minister. (2003). Den Europäischen Hochschulraum verwirklichen. Kommuniqué der Konferenz der europäischen Hochschulministerinnen und - minister am 19. September 2003 in Berlin. Zugriff am 03.03.2014. Verfügbar unter http://www.bologna-berlin2003.de/pdf/Communique_dt.pdf Koslowski, B. (1996). Theory and evidence. The development of scientific reasoning (Learning, development, and conceptual change). Cambridge, Massachusetts: MIT Press. Kreisel, G. (1980). Modell. In J. Speck (Hrsg.), Handbuch wissenschaftstheoretischer Begriffe (UTB, Bd. 967, Bd. 2, S. 437–440). Göttingen: Vandenhoeck & Ruprecht. Kröger, J., Neumann, K. & Petersen, S. (2014). Erfassung des Professionswissens angehender Physiklehrkräfte im Rahmen des Projekts KiL. In S. Bernholt (Hrsg.), Naturwissenschaftliche Bildung zwischen Scienceund Fachunterricht (S. 117–119). Kiel: GDCP. Zugriff am 24.04.2015. Verfügbar unter http://www.gdcp.de/images/tb2014/TB2014_117_Kroeger.pdf Kröger, J., Neumann, K. & Petersen, S. (2015). Struktur und Entwicklung des Professionswissens angehender Physiklehrkräfte. In S. Bernholt (Hrsg.), Heterogenität und Diversität - Vielfalt der Voraussetzungen im naturwissenschaftlichen Unterricht (S. 106–108). Kiel: IPN. Zugriff am 24.05.2015. Verfügbar unter http://www.gdcp.de/images/tb2015/TB2015_106_Kroeger.pdf Kuhn, D., Amsel, E. & O'Loughlin, M. (1988). The development of scientific thinking skills (Developmental psychology series). San Diego: Academic Press. Kuhn, T. S. (1974a). Logik der Forschung oder psychologie der wissenschaftlichen Arbeit. In I. Lakatos & A. Musgrave (Hrsg.), Kritik und Erkenntnisfortschritt (Its Abhandlungen, Bd. 4, S. 1– 24). Braunschweig: Vieweg. Kuhn, T. S. (1976b). Die Struktur wissenschaftlicher Revolutionen (Suhrkamp Taschenbuch Wissenschaft, Bd. 25, 2. Aufl.). Frankfurt am Main: Suhrkamp. Kultusministerkonferenz. (2005). Bildungsstandards im Fach Physik für den Mittleren Schulabschluss (Jahrgangsstufe 10). München: Wolter Kluwer (Beschlüsse der Kultusministerkonferenz).
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 140 Kultusministerkonferenz. (2010). Ländergemeinsame inhaltliche Anforderungen für die Fachwissenschaften und Fachdidaktiken in der Lehrerbildung. München: Wolter Kluwer (Beschlüsse der Kultusministerkonferenz) Lakatos, I. (1974). Falsifikation und die Methodologie wissenschaftlicher Forschungsprogramme. In I. Lakatos & A. Musgrave (Hrsg.), Kritik und Erkenntnisfortschritt (Its Abhandlungen, Bd. 4, S. 89–182). Braunschweig: Vieweg. Lawson, A. E. (2002). Sound and faulty arguments generated by preservice biology teachers when testing hypotheses involving unobservable entities. Journal of Research in Science Teaching, 39 (3), 237–252. Leisner-Bodenthin, A. (2006). Zur Entwicklung von Modellkompetenz im Physikunterricht. Zeitschrift für Didaktik der Naturwissenschaften, 12, 91–109. Liepmann, D., Beauducel, A., Brocke, B. & Nettelnstroth, W. (2012). Intelligenz-Struktur-Test – Screening. Göttingen: Hogrefe. Linacre, J. M. (1994). Sample Size and Item Calibration [or Person Measure] Stability. Rasch Measurement Transactions, 7 (4), 328. Zugriff am 25.05.2015. Verfügbar unter http://www.rasch.org/rmt/rmt74m.htm Lipowsky, F. (2006). Auf den Lehrer kommt es an. Empirische Evidenzen für Zusammenhänge zwischen Lehrerkompetenzen, Lehrerhandeln und dem Lernen der Schüler. In C. AllemannGhionda & E. Terhart (Hrsg.)Kompetenzen und Kompetenzentwicklung von Lehrerinnen und Lehrern. Zeitschrift für Pädagogik. 51, 47–70 [Themenheft]. Weinheim: Beltz. Majer, U. (1980). Experiment in den Naturwissenschaften. In J. Speck (Hrsg.), Handbuch wissenschaftstheoretischer Begriffe (UTB, Bd. 967, Bd. 1, S. 208–210). Göttingen: Vandenhoeck & Ruprecht. Mathesius, S. (in Vorbereitung). Wissenschaftliches Denken im Hochschulstudium von Biologiestudierenden. Dissertation, Freie Universität Berlin. Berlin. Mayer, J. (2007). Erkenntnisgewinnung als wissenschaftliches Problemlösen. In D. Krüger & H. Vogt (Hrsg.), Theorien in der biologiedidaktischen Forschung. Ein Handbuch für Lehramtsstudenten und Doktoranden (S. 177–184). Berlin: Springer. Mayer, J., Grube, C. & Möller, A. (2008). Kompetenzmodell naturwissenschaftlicher Erkenntnisgewinnung. In R. Klee & U. Harms (Hrsg.), Ausbildung und Professionalisierung von Lehrkräften. Internationale Tagung der Fachsektion Didaktik der Biologie im VBiO, Essen 2007 (Forschungen zur Fachdidaktik, Bd. 10, S. 63–79). Innsbruck: StudienVerl. Mayer, J. & Wellnitz, N. (2014). Die Entwicklung von Kompetenzstrukturmodellen. In D. Krüger, I. Parchmann & H. Schecker (Hrsg.), Methoden in der naturwissenschaftsdidaktischen Forschung (S. 19–29). Berlin, Heidelberg: Springer. Mayer, R. E. (2012). Problem Solving. In V. S. Ramachandran (Hrsg.), Encyclopedia of Human Behavior (S. 181–186). Oxford: Elsevier.
Literaturverzeichnis 141 Menne, A. (1980). Einführung in die Methodologie: elementare allgemeine wissenschaftliche Denkmethoden im Überblick. Darmstadt: Wissenschaftliche Buchgesellschaft. Messick, S. (1995). Validity of psychological assessment: Validation of inferences from persons' responses and performances as scientific inquiry into score meaning. American Psychologist, 50 (9), 741–749. Microsoft. (2010) Excel 2010 [Computer software]. Mittelstrass, J. (1973). Das praktische Fundament der Wissenschaft und die Aufgabe der Philosophie. In F. Kambartel & J. Mittelstrass (Hrsg.), Zum normativen Fundament der Wissenschaft (Wissenschaftliche Paperbacks. Grundlagenforschung : Studien, Bd. 1, S. 1–69). Frankfurt (M.): Athenäum-Verlag. Monseur, C. & Adams, R. (2009). Plausible Values: How to deal with their Limitations. Journal of applied Measurement, 10 (3), 1–15. Moosbrugger, H. (2012). Item-Response-Theory (IRT). In H. Moosbrugger & A. Kelava (Hrsg.), Springer-Lehrbuch (S. 227–274). Berlin: Springer. Moosbrugger, H. & Kelava, A. (2012a). Qualitätsanforderungen an einen psychologischen Test (Testgütekriterien). In H. Moosbrugger & A. Kelava (Hrsg.), Springer-Lehrbuch (S. 7–26). Berlin: Springer. Moosbrugger, H. & Kelava, A. (2012b). Testtheorie und Fragebogenkonstruktion (Springer-Lehrbuch, 2. Aufl.). Berlin: Springer. Morrison, J. A. (2014). SCIENTISTS’ PARTICIPATION IN TEACHER PROFESSIONAL DEVELOPMENT: THE IMPACT ON FOURTH TO EIGHTH GRADE TEACHERS’ UNDERSTANDING AND IMPLEMENTATION OF INQUIRY SCIENCE. International Journal of Science and Mathematics Education, 12, 793–816. Neumann, K. (2014). Rasch-Analyse naturwissenschaftsbezogener Leistungstests. In D. Krüger, I. Parchmann & H. Schecker (Hrsg.), Methoden in der naturwissenschaftsdidaktischen Forschung (S. 355–369). Berlin, Heidelberg: Springer. Nowak, K. H., Nehring, A., Tiemann, R. & Upmeier zu Belzen, A. (2013). Assessing students’ abilities in processes of scientific inquiry in biology using a paper-and-pencil test. Journal of Biological Education, 47 (3), 182–188. OECD. (2009). PISA data analysis manual. SPSS (2nd ed). Paris: OECD. Oh, P. S. & Oh, S. J. (2011). What Teachers of Science Need to Know about Models: An overview. International Journal of Science Education, 33 (8), 1109–1130. Oser, F., Curcio, G.-P. & Düggeli, A. (2007). Kompetenzmessung in der Lehrerbildung als Notwendigkeit - Fragen und Zugänge. Beiträge zur Lehrerbildung, 25 (1), 14–26. Pant, H. A., Stanat, P., Schroeders, U., Roppelt, A., Siegle, T. & Pöhlmann, C. (Hrsg.). (2013). IQB-Ländervergleich 2012. Mathematische und naturwissenschaftliche Kompetenzen am Ende der Sekundarstufe I. Münster: Waxmann.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 142 PhysLab. (2014). Radioaktivität, die natürlichste Sache der Welt?, Freie Universität Berlin. Verfügbar unter http://www.physik.fu-berlin.de/studium/schulkontakte/physlab/labor/ img/Radioaktivitaet_2014_03_18_ohne_Anhang_ohne-Logarithmieren.pdf Pierce, C. A., Block, R. A. & Aguinis, H. (2004). Cautionary note on reporting eta-squared values from multifactor ANOVA Designs. Educational and Psychological Measurement, 64 (6), 916–924. Verfügbar unter http://www.montana.edu/rblock/documents/papers/PierceBlock Aguinas2004.pdf Pietschmann, H. (1996). Phänomenologie der Naturwissenschaft. Wissenschaftstheoretische und philosophische Probleme der Physik. Berlin: Springer. Popper, K. R. (1974). Die Normalwissenschaft und ihre Gefahren. In I. Lakatos & A. Musgrave (Hrsg.), Kritik und Erkenntnisfortschritt (Its Abhandlungen, Bd. 4, S. 51–57). Braunschweig: Vieweg. Popper, K. R. (1984). Logik der Forschung (Einheit der Gesellschaftswissenschaften, Bd. 4, 8. Aufl.). Tübingen: J.C.B. Mohr (Paul Siebeck). Popper, K. R. (2010). Lesebuch. Ausgewählte Texte zur Erkenntnistheorie, Philosophie der Naturwissenschaften, Metaphysik, Sozialphilosophie (UTB, Bd. 2000, 2. Auflage). Stuttgart: UTB GmbH. Rasch, B., Friese, M., Hofmann, W. & Naumann, E. (2014). Quantitative Methoden II. Einführung in die Statistik für Psychologen und Sozialwissenschaftler (Springer-Lehrbuch, Bd. 2, 4. Aufl., 2 Bände). Berlin: Springer. Rehfeldt, D., Mühlenbruch, T. & Nordmeier, V. (2015). Fragebogen zu Praktikumskompetenzen (PraKo): Erforschung naturwissenschaftlicher Praktika. In S. Bernholt (Hrsg.), Heterogenität und Diversität - Vielfalt der Voraussetzungen im naturwissenschaftlichen Unterricht (S. 420–422). Kiel: IPN. Zugriff am 01.06.2015. Verfügbar unter http://www.gdcp.de/images/tb2015/TB2015_ 420_Rehfeldt.pdf Rehfeldt, D., Straube, P., Stiller, J., Kratschmar, J. & Nordmeier, V. (in Vorbereitung). Validierung PraQ (Arbeitstitel). Ricco, R. B. & Overton, W. F. (2012). Reasoning. In V. S. Ramachandran (Hrsg.), Encyclopedia of Human Behavior (S. 257–264). Oxford: Elsevier. Riese, J. (2009). Professionelles Wissen und professionelle Handlungskompetenz von (angehenden) Physiklehrkräften (Studien zum Physikund Chemielernen, Bd. 97). Berlin: Logos. Riese, J. & Reinhold, P. (2012). Die professionelle Kompetenz angehender Physiklehrkräfte in verschiedenen Ausbildungsformen. Zeitschrift für Erziehungswissenschaft, 15 (1), 111–143. Riese, J. & Reinhold, P. (2014). Entwicklung eines Leistungstests für fachdidaktisches Wissen. In D. Krüger, I. Parchmann & H. Schecker (Hrsg.), Methoden in der naturwissenschaftsdidaktischen Forschung (S. 257–267). Berlin, Heidelberg: Springer. Rost, J. (2004). Lehrbuch Testtheorie-Testkonstruktion (2. Aufl.). Bern: Verlag Hans Huber.
Literaturverzeichnis 143 Roth, W.-M., McGinn, M. K. & Bowen, G. M. (1998). How prepared are preservice teachers to teach scientific inquiry? Levels of performance in scientific representation practices. Journal of science teacher education, 9 (1), 25–48. Sadler, P. M. (1998). Psychometric Models of Student Conceptions in Science: Reconciling Qualitative Studies and Distractor-Driven Assessment Instruments. Journal of Research in Science Teaching, 35 (3), 265–296. Schecker, H. & Parchmann, I. (2006). Modellierung naturwissenschaftlicher Kompetenz. Zeitschrift für Didaktik der Naturwissenschaften, 12, 45–66. Schmiemann, P. & Lücken, M. (2014). Validität – Misst mein Test, was er soll? In D. Krüger, I. Parchmann & H. Schecker (Hrsg.), Methoden in der naturwissenschaftsdidaktischen Forschung (S. 107–118). Berlin, Heidelberg: Springer. Schnell, R., Hill, P. B. & Esser, E. (2011). Methoden der empirischen Sozialforschung (9., aktualis. Auflage). München: Oldenbourg, R. Schreiber, N., Theyßen, H. & Schecker, H. (2009). Experimentelle Kompetenz messen?! Physik und Didaktik in Schule und Hochschule, 8 (3), 92–101. Schroeders, U., Penk, C., Jansen, M. & Pant, H. A. (2013). Geschlechtsbezogene Disparitäten. In H. A. Pant, P. Stanat, U. Schroeders, A. Roppelt, T. Siegle & C. Pöhlmann (Hrsg.), IQBLändervergleich 2012. Mathematische und naturwissenschaftliche Kompetenzen am Ende der Sekundarstufe I (S. 249–274). Münster: Waxmann. Schwartz, R. S., Lederman, N. G. & Crawford, B. A. (2004). Developing Views of Nature of Science in an Authentic Contex: An Explicit Approach to Bridging the Gap Between Nature of Science and Scientific Inquiry. Science Teacher Education, 600–645. Shamos, M. H. (1959). Great Experiments in Physics. New York: Holt, Rinehart and Winston. Shavelson, R. J. (2013). An approach to testing & modelling competence. In S. Blömeke, O. Zlatkin-Troitschanskaia, C. Kuhn & J. Fege (Hrsg.), Modeling and measuring competencies in higher education. Tasks and challenges (Professional and VET learning, Bd. 1, S. 29–43). Rotterdam: Sense Publishers. Shulman, L. (1986a). Those who understand: Knowledge growth in teaching. Educational Researcher, 15, 4–14. Shulman, L. (1987b). Knowledge and teaching: Foundations of the new reform. Harvard educational review, 57 (1), 1–23. Sippel, S. (2009). Zur Relevanz von Assessment-Feedback in der Hochschullehre. Zeitschrift für Hochschulentwicklung, 4 (1), 1–22. Stecher, B. M. & Klein, S. P. (1997). The Cost of Science Performance Assessments in LargeScale Testing Programs. Educational Evaluation and Policy, 19, 1–14.
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 144 Stiller, J. (in Vorbereitung). Analyse von Struktur und Entwicklung der Kompetenzen Studierender des Lehramts im Bereich Scientific Reasoning. Eine Querschnittsstudie im Fach Chemie. Dissertation, Humboldt Universität zu Berlin. Berlin. Stiller, J., Straube, P., Hartmann, S., Nordmeier, V. & Tiemann, R. (2015). Erkenntnisgewinnungskompetenz Chemie und Physik-Lehramtsstudierender: Untersuchungen zu Domänenspezifität. In J. Stiller & C. Laschke (Hrsg.), Berlin-Brandenburger Beiträge zur Bildungsforschung 2015. Herausforderungen, Befunde und Perspektiven interdisziplinärer Bildungsforschung (S. 179–202). Frankfurt a.M.: Peter Lang. Stöckler, M. (1995). Modell, Idealisierung und Realität. Theoretische Modelle im Lichte der Wissenschaftstheorie. Praxis der Naturwissenschaften - Physik, 44 (1), 16–21. Straube, P. & Nordmeier, V. (2014). Ko - WADiS - Erkenntnisgewinnungskompetenz von Lehramtsstudierenden. In V. Nordmeier & H. Grötzebauch (Hrsg.), PhyDid B, Didaktik der Physik, Beiträge zur DPG-Frühjahrstagung. Berlin: DPG. Zugriff am 13.04.2015. Verfügbar unter http://www.phydid.de/index.php/phydid-b/article/download/583/643 Strelow, S., Straube, P. & Nordmeier, V. (2014). Falsifikation als naturwissenschaftliche Methode der Erkenntnisgewinnung. Praxis der Naturwissenschaften - Physik in der Schule, 63 (8), 22–26. Sun, X. (2012). Conquest Notes 7 - Using Mantel-Haenszel Statistics. Zugriff am 05.12.2014. Verfügbar unter http://www.acer.edu.au/files/Conquest-Notes-7-UsingMantel-HaenszelStatistics.pdf Taylor, J. A. & Dana, T. M. (2003). Secondary school physics teachers' conceptions of scientific evidence: An exploratory case study. Journal of Research in Science Teaching, 40 (8), 721–736. Tepner, O., Borowski, A., Dollny, S., Fischer, H. E., Jüttner, M., Kirschner, S. et al. (2012). Modell zur Entwicklung von Testitems zur Erfassung des Professionswissens von Lehrkräften in den Naturwissenschaften. Zeitschrift für Didaktik der Naturwissenschaften, 18, 7–28. Upmeier zu Belzen, A. & Krüger, D. (2010). Modellkompetenz im Biologieunterricht. Zeitschrift für Didaktik der Naturwissenschaften, 16, 41–57. van Driel, J., Berry, A. & Meirink, J. (2014). Research on Science Teacher Knowledge. In S. K. Abell & N. G. Lederman (Hrsg.), Handbook of research on science education (2. Aufl., S. 848–870). London: Routledge. Van Driel, Jan H. & Verloop, N. (1999). Teachers' knowledge of models and modelling in science. International Journal of Science Education, 21 (11), 1141–1153. Vogelsang, C. (2014). Validierung eines Instruments zur Erfassung der professionellen Handlungskompetenz von (angehenden) Physiklehrkräften. Zusammenhangsanalysen zwischen Lehrerkompetenz und Lehrerperformanz (Studien zum Physikund Chemielernen, Bd. 174). Berlin: Logos. Walpulski, M., Kauertz, A., Kampa, N., Fischer, H. E., Mayer, J., Sumfleth, E. et al. (2010). ESNaS - Evaluation der Standards für die Naturwissenschaften in der Sekundarstufe I. In A. Gehrmann (Hrsg.), Bildungsstandards und Kompetenzmodelle. Beiträge zu einer aktuellen Diskussion über Schule, Lehrerbildung und Unterricht (S. 171–184). Bad Heilbrunn: Klinkhardt.
Literaturverzeichnis 145 Weinert, F. E. (2001a). Concept of Competence - a conceptual clarification. In D. S. Rychen & L. H. Salganik (Hrsg.), Defining and selecting key competencies (S. 45–65). Seatle: Hogrefe&Huber. Weinert, F. E. (2001b). Leistungsmessungen in Schulen (Beltz-Pädagogik). Weinheim [u.a.]: Beltz. Wellnitz, N. (2012). Kompetenzstruktur und -niveaus von Methoden naturwissenschaftlicher Erkenntnisgewinnung (Biologie lernen und lehren, Bd. 2). Berlin: Logos. Wellnitz, N., Fischer, H. E., Kauertz, A., Mayer, J., Neumann, I., Pant, H. A. et al. (2012). Evaluation der Bildungsstandards - eine fächerübergreifende Testkonzeption für den Kompetenzbereich Erkenntnisgewinnung. Zeitschrift für Didaktik der Naturwissenschaften, 18, 261–291. Wiltsche, H. A. (2013). Einführung in die Wissenschaftstheorie (UTB: Philosophie, Bd. 3936). Göttingen: Vandenhoeck et Ruprecht. Windschitl, M. (2003). Inquiry projects in science teacher education: What can investigative experiences reveal about teacher thinking and eventual classroom practice? Science Teacher Education, 87 (1), 112–143. Wissenschaftsrat. (2008). Empfehlungen zur Qualitätsverbesserung von Lehre und Studium (Drs. 8639-08). Zugriff am 03.04.2016. Verfügbar unter http://www.wissenschaftsrat.de/download/archiv/ 8639-08.pdf Woitkowski, D. (2015). Fachliches Wissen Physik in der Hochschulausbildung. Dissertation, Universität Paderborn. Paderborn. Woitkowski, D., Riese, J. & Reinhold, P. (2011). Modellierung fachwissenschaftlicher Kompetenz angehender Physiklehrkräfte. Zeitschrift für Didaktik der Naturwissenschaften, 17, 289–313. Woitkowski, D., Riese, J. & Reinhold, P. (2014). Prospective physicists' and physics teachers' content knowledge. First Results of a Germany-Wide Study. In C. P. Constantinou, N. Papadouris & A. Hadjigeorgiou (Hrsg.), E-Book Proceedings of the ESERA 2013 Conference: Science Education Research For Evidence-based Teaching and Coherence in Learning (S. 28–37). Nicosia: European Science Education Research Association. Zugriff am 22.04.2015. Verfügbar unter http://www.esera.org/media/eBook_2013/Strand%2013/ESERA_eBook_Part_13.pdf Worral, J. (1980). Wie die Methodologie der wissenschaftlichen Forschungsprogramme die Poppersche Methodologie verbessert. In G. Radnitzky, H. Albert & G. Andersson (Hrsg.), Fortschritt und Rationalität der Wissenschaft (S. 51–73). Tübingen: Mohr. Wright, B. D. & Linacre, J. M. (1994). Reasonable mean-square fit values. Rasch Measurement Transactions, 8 (3), 370. Zugriff am 12.05.2015. Verfügbar unter http://www.rasch.org/rmt/rmt83b.htm Wu, M. (2005). The role of plausible values in large-scale surveys. Studies in Educational Evaluation, 31 (2-3), 114–128. Wu, M. & Adams, R. (2007). Applying the Rasch Model to psycho-social measurement. a practical approach, Educational Measurement Solutions. Zugriff am 12.05.2015. Verfügbar unter http://www.edmeasurement.com.au/_publications/RaschMeasure ment_Complete.pdf
Modellierung und Erfassung von Kompetenzen naturwissenschaftlicher Erkenntnisgewinnung 146 Wu, M., Adams, R., Wilson, M. & Haldane, S. (2007). Acer Conquest 2.0. Generalised Item response modelling software. Camberwell: Acerpress. Yip, D. Y. (2001). Assessing and Developing the concept of Assumptions in Science Teachers. Journal of Science Education and Technology, 10 (2), 173–179. Zimmerman, C. (2000). The Development of Scientific Reasoning Skills. Developmental Review, 20 (1), 99–149. Zlatkin-Troitschanskaia, O. & Kuhn, C. (2010). Messung akademisch vermittelter Fertigkeiten und Kenntnisse von Studierenden bzw. Hochschulabsolventen. Analyse zum Forschungsstand. Arbeitspapiere WP (56), 1–33. Zwick, R., Thayer, D. T. & Lewis, C. (1999). An Empirical Bayes Approach to Mantel-Haenszel DIF Analysis. Journal of Educational Measurement, 36 (1), 1–28. Das Literaturverzeichnis wurde mit Hilfe der Software Citavi 4 erstellt.
Anlagen 147 11. Anlagen Test auf Normalverteilung Fragestellungen 2-5 D(187)=0,061, n.s. S(187)=0,982, p=0,014 v=-0,414 (0,178) 𝑍𝑍𝑆𝑆= 2,32 w=0,046 (0,354) 𝑍𝑍𝐾𝐾= 0,13 D(308)=0,041, n.s. S(308)=0,995, n.s. v=-0,208 (0,139) 𝑍𝑍𝑆𝑆= 1,50 w=0,149 (0,277) 𝑍𝑍𝐾𝐾= 0,54 D(187)=0,065, n.s. S(187)=0,982, p=0,016 v=0,366(0,178) 𝑍𝑍𝑆𝑆= 2,01 w=-0,168(0,354) 𝑍𝑍𝐾𝐾= 0,47 D(343)=0,040, n.s. S(343)=0,996, n.s. v= 0,021 (0,132) 𝑍𝑍𝑆𝑆= 0,16 w=0,161 (0,263) 𝑍𝑍𝐾𝐾= 0,61 D(339)=0,044, n.s. S(339)=0,995, n.s. v=-0,107 (0,132) 𝑍𝑍𝑆𝑆= 0,81 w=0,495 (0,264) 𝑍𝑍𝐾𝐾= 1,88