Zurückhaltend – oder aus guten Gründen dagegen?

Dass die Folgen generativer KI für Studium und Lehre öffentlich diskutiert werden, ist wichtig. Hochschulen stehen vor Fragen, die Prüfungen, Lehrformate, didaktische Konzepte, Datenschutz, akademische Integrität und nicht zuletzt das Verständnis von Hochschulbildung selbst betreffen. Befragungen können dazu beitragen, diese Fragen sichtbar zu machen und einen Überblick darüber zu geben, wie Hochschulen mit ihnen umgehen. Das Hochschulforum Digitalisierung leistet mit seinen Monitoren seit Jahren einen Beitrag dazu. Gerade weil solche Studien den Diskurs mitprägen, lohnt sich ein genauer Blick darauf, wie sie angelegt sind und was sie tatsächlich zeigen können.

Der HFD-Monitor 2026 „Personalisiertes Lernen im KI-Zeitalter“ (Budde, Sommer & Lüthi, 2026) will eine solche Bestandsaufnahme sein. Bei näherem Hinsehen bestätigt er aber eher die Agenda seiner Herausgeber (HFD/CHE). Meine Kritik richtet sich nicht primär auf einzelne Items der Befragung oder auf resultierende Zahlen, sondern auf die Anlage der Studie: auf ihre normativen Vorannahmen, die Engführung der Antwortmöglichkeiten, die flexible Auslegung methodischer Standards, die Typenbildung und die einseitige Interpretation. Seitenangaben beziehen sich auf den Bericht (PDF), Fragenummern auf den Fragebogen.

Normative Vorannahmen, die nicht offengelegt werden

Das Ziel steht offenbar fest, bevor gefragt wird. Schon der Einleitungstext des Fragebogens gibt den Befragten die Richtung vor: Mit digitalen Technologien und KI verbinde sich „die Hoffnung, Lernprozesse durch Personalisierung individueller, flexibler und effizienter zu gestalten“. Der Bericht begründet die Studie mit einer ähnlichen Formel (S. 44: Hochschulen durch Personalisierung mittels KI effizienter gestalten) und spricht von einer „Lücke“ zwischen den „Potentialen“ digitaler Technologien und ihrer Verankerung (S. 3). Gefragt wird also nicht, ob Personalisierung und Effizienz die richtigen Maßstäbe für eine Weiterentwicklung der Hochschulbildung in Zeiten von KI sind. Gefragt wird nur, wie weit die Hochschulen auf dem Weg (hin zu mehr Digitalisierung) gekommen sind.

Andere Umgangsweisen mit KI kommen in den geschlossenen Fragen nicht vor. Der Wissenschaftsrat hat im Juli 2026 mit „Intellektuelle Souveränität: Empfehlungen für die Hochschulbildung in Zeiten von generativer KI“ eine alternative Perspektive formuliert, unter anderem mit KI-freien Räumen im Curriculum, der Stärkung persönlicher Betreuung und sozialer Interaktion. Eine Hochschule, die vielleicht aus solchen Überlegungen heraus bewusst auf bestimmte KI-Einsatz-Szenarien verzichtet, kann das nur als „nicht vorgesehen“ angeben (Fragen 2.4, 3.2). Im Index zählt das als 0, in der Typologie als „zurückhaltend“. In den Freitext-Antworten (Frage 3.4) kommt aber offenbar durchaus vor, dass Hochschulen auch kritische Reflexion im Zusammenhang mit KI stärken wollen (S. 24); näher ausgeführt wird dieser Part leider nicht.

Engführung der Antwortmöglichkeiten

Die Befragten konnten sich nur innerhalb eines vorgegebenen Rahmens äußern (was bei geschlossenen Fragen natürlich immer der Fall ist). Doch in die Antwortskalen ist bei den Item-Gruppen zu Einsatzszenarien mit KI eine Fortschrittslogik eingeschrieben: nicht vorgesehen – in Planung – im Pilotbetrieb – im Regelbetrieb (Fragen 2.4, 3.2) bzw. mit Blick auf Verbreitungsgrad bestimmter Formen des Digitalen: gar nicht verbreitet bis in der Breite angekommen (Frage 2.2). Das Ende der Skala erscheint jeweils als Ziel, alles andere als Vorstufen.

Frage 1.1 lautet: „Wie wichtig sind die folgenden übergreifenden strategischen Ziele für Ihre Hochschule im Kontext der Digitalisierung von Studium und Lehre?“ Die Ziele erscheinen damit als etwas, das die Digitalisierung voranbringen soll. Ob die Digitalisierung manche dieser Ziele auch erschweren könnte, ist nicht Gegenstand der Frage. Die Liste selbst ist gemischt: Neben allgemeinen Zielen wie Studienqualität oder Studienerfolg stehen Begriffe des Digitalisierungsdiskurses wie Flexibilisierung, Personalisierung oder „Seamless Learning“. Ziele, die zu diesen Begriffen in Spannung stehen können, fehlen: gemeinsame Präsenzzeiten gegenüber zeitlicher Flexibilisierung, der Schutz persönlicher Daten gegenüber datenbasierter Personalisierung, eigenständiges Urteilen ohne KI-Unterstützung gegenüber der Vorbereitung auf eine KI-geprägte Arbeitswelt. Die Befragten bewerten jedes Ziel für sich auf einer Skala von „gar nicht wichtig“ bis „sehr wichtig“. Sie müssen nicht entscheiden, welches Ziel wichtiger ist als ein anderes. Da liegt es nahe, fast alles als wichtig einzustufen, denn wer würde Studienqualität oder Chancengerechtigkeit für unwichtig erklären? Entsprechend stellt der Bericht fest, dass „alle abgefragten Optionen für die Hochschulen in unterschiedlicher Ausprägung wichtig sind“ (S. 7).

Die meisten offenen Fragen gehen in dieselbe Richtung: Sie erkunden weitere Ziele, Szenarien, Ansätze und Projekte. Nach Gründen gegen einen Einsatz, nach Bedenken oder nach gescheiterten Vorhaben wird nicht gefragt.

Flexible Auslegung methodischer Standards

Besonders auffällig ist für mich, dass die Aussagen, die der Bericht macht, weiter reichen als es die Daten hergeben. Befragt wurde für jede Hochschule eine Person aus der Leitung, „vorrangig“ die Vizepräsidentin oder der Prorektor für Lehre (S. 45). Für Fragen der Strategie ist das eine naheliegende Zielgruppe. Der Bericht macht aus diesen Auskünften aber mehr: Er behandelt sie als Umsetzungsstand der ganzen Hochschule und bildet daraus Hochschulprofile. Wie Lehrende, Studierende oder Fachbereiche den Stand einschätzen, bleibt dabei außen vor.

Die Studie ist außerdem selbstbezüglich angelegt, ohne dass dies ausreichend reflektiert wird. Der Fragebogen beruht auf den eigenen Vorgängerbefragungen und „anderen Aktivitäten des HFD“ (S. 44). Als Einflussfaktor strategischer Entscheidungen werden „Formate und Publikationen des HFD“ (warum nur die) als Item aufgenommen (Frage 4.1); eine offene Frage zu gewünschten Angeboten oder Impulsen beziehen sich ebenfalls nur auf das HFD selbst (Frage 4.4). Befragt werden Hochschulleitungen, deren Verband, die HRK, das HFD mitträgt (S. 57). Und das zentrale Ergebnis, nämlich offenbar eine Lücke zwischen Relevanz und Umsetzung (S. 20), beschreibt genau den Bedarf, für den das HFD Unterstützung anbietet.

Was mich methodisch ebenfalls stört ist, dass aus einer methodischen Vereinfachung eine Einstufung wird. Was meine ich damit? Für die Indexbildung hat der Bericht die Antwortkategorien der Fragen zum Umsetzungsstand (Fragen 2.4 und 3.2) in Zahlen übersetzt: 0 für „nicht vorgesehen“, 1 für „in Planung“, 2 für „im Pilotbetrieb“, 3 für „im Regelbetrieb“ (S. 48). Diese Zahlen geben nur eine Reihenfolge an. Trotzdem bildet der Bericht für jede Hochschule einen Durchschnitt über die abgefragten Szenarien (S. 48). Ein Durchschnitt unterstellt aber, dass der Schritt von der Planung zum Pilotbetrieb genauso groß ist wie der vom Pilot- zum Regelbetrieb. Das ist in der Umfrageforschung nicht unüblich und als grobe Näherung oft vertretbar. Problematisch wird es, wenn auf dieser Näherung Hochschulen eingestuft und kategorisiert werden. Dann entscheidet eine grobe Rechengröße darüber, ob eine Hochschule als „zurückhaltend“ oder als „fortgeschritten“ gilt. Der Bericht räumt selbst ein, dass die Stufen nicht gleichwertig sind: Die Grenzen zwischen den vier Profilen seien bewusst ungleich gezogen, weil höhere Werte inhaltlich etwas anderes bedeuten (S. 48). Sind die Stufen aber nicht gleichwertig, lässt sich aus ihnen eben auch kein Durchschnitt bilden. Für eine Studie, die Hochschulen öffentlich einordnet, ist das zu wenig Sorgfalt.

Dazu kommt: Was mit den Freitexten geschieht, bleibt offen. Der Fragebogen enthält etliche offene Fragen. Der kurze Methodenteil kündigt eine „teils qualitative“ Befragung an (S. 44), sagt aber nicht, wie die Antworten ausgewertet wurden: weder Kategorien noch Kodierung noch Zahl der Antworten. Im Bericht erscheinen Freitexte an drei Stellen: ein einzelnes Zitat (S. 6), eine Tabelle „typischer Aspekte“ zu Frage 3.4 (S. 24) und ein zusammenfassender Satz (S. 41). Was etwa auf die Fragen nach weiteren Einflussfaktoren und nach Bedarfen (4.2, 4.3) geantwortet wurde, erfährt man nicht. Gerade dort hätten sich Positionen zeigen können, die der geschlossene Teil nicht vorsieht.

Und schließlich werden methodische Begriffe mitunter ungenau oder großzügig verwendet. Der Fragebogen gilt als durch einen Pretest „validiert“ (S. 44). Ein Pretest prüft aber on der Regel Verständlichkeit, eine Validierung im methodischen Sinn leistet er nicht. Die Stichprobe soll eine „repräsentative Vergleichbarkeit“ zwischen Hochschulen unterschiedlicher Größe ermöglichen (S. 46) – eine Formulierung, die Repräsentativität und Vergleichbarkeit vermischt. Unmittelbar danach räumt der Bericht ein, dass große Hochschulen über- und kleine unterrepräsentiert sind. Gerade die kleinen Hochschulen sind es aber, die später als „Zurückhaltende“ erscheinen (S. 29). Auch theoretische Konzepte (was zu einem methodisch sauberen Arbeiten ebenfalls gehört) lassen in ihrer Darstellung und Verwendung Sorgfalt vermissen: Adaptives Lernen etwa mag ein verbreiteter Begriff sein, logisch ist er dennoch nicht: Adaptiv kann nur ein Lehrprozess etwa in Reaktion auf Veränderungen im Lernverhalten sein – um nur ein Beispiel zu nennen.

Umsetzungsprofile ohne Grundlage

Am weitesten geht der Bericht dort, wo er aus den Daten Hochschulprofile bildet. Für den Einsatz von KI-Chatbots in Lehre und Lernen fasst er drei Items aus Frage 3.2 zu einem Index zusammen: KI-gestützte Lernassistenten für das Selbststudium, KI-Funktionen im Learning-Management-System und die Möglichkeit für Lehrende, Chatbots mit eigenen Kursdaten zu speisen. Der Index ist der Mittelwert dieser drei Angaben. Je nach Wert wird jede Hochschule einer von vier Stufen zugeordnet. So entstehen 34 „Zurückhaltende“, 32 „Planende“, 33 „Experimentierende“ und 13 „Fortgeschrittene“ (S. 28).

Was der Index leisten soll, sagt der Bericht an mehreren Stellen: Er diene der „zusammenfassenden Einordnung des institutionellen Umsetzungsstands“ (S. 48) und zeige, „wie weit die Hochschulen insgesamt bei der Umsetzung sind“ (S. 33). Je höher der Wert, „desto stärker sind KI-Chatbots in Lehr- und Lernsettings institutionell verankert“ (S. 28). Die Sprache ist die eines Stufenmodells: Hochschulen haben „unterschiedliche Entwicklungsstände erreicht“ (S. 28), und beim Index zu Learning Analytics „erreicht“ nur eine von 112 Hochschulen „die höchste Stufe“ (S. 42). Der Index soll also ein Maß dafür sein, wie weit eine Hochschule ist. Diesen Anspruch kann er definitiv nicht einlösen.

Die Profilnamen passen oft nicht zu den Angaben. Ganz unterschiedliche Antworten ergeben denselben Durchschnitt. Eine Hochschule, die ein Szenario bereits im Regelbetrieb hat und die beiden anderen nicht vorsieht, erhält denselben Wert wie eine Hochschule, die alle drei Szenarien erst plant. Beide gelten als „Planende“ – die erste, obwohl sie gar nichts plant. Eine Hochschule, die zwei Szenarien im Regelbetrieb hat und auf das dritte verzichtet, zählt zu den „Experimentierenden“, obwohl sie nichts erprobt (S. 28, 48). Die Namen beschreiben also Tätigkeiten, die im Antwortprofil einer Hochschule gar nicht vorkommen müssen. Offen bleibt auch, wie „kann ich nicht einschätzen“ behandelt wurde.

Der Bericht räumt selbst ein, dass der Umsetzungsstand „keine Rückschlüsse“ darauf zulässt, „wie die Anwendungen didaktisch ausgestaltet und in bestehende Lehr-/Lernprozesse eingebettet sind“ (S. 25). Fortgeschritten ist eine Hochschule nach diesem Index also nicht in der Qualität ihrer Lehre, sondern darin, wie weit ihre KI-Angebote in den Regelbetrieb gelangt sind. Trotzdem aber werden die Profile zum Maßstab. Auch Begründungen werden mitgeliefert, die erklären sollen, was die „Fortgeschrittenen“ offenbar richtig machen (S. 30): Bei den „Fortgeschrittenen“ dürften Faktoren wie „eine klare strategische Priorisierung des Themas, institutionelle Governance-Strukturen oder ein frühzeitiger Aufbau entsprechender Kompetenzen und Infrastrukturen“ eine Rolle spielen. Erhoben wurde davon nichts. Die Passage liest sich dennoch wie eine Anleitung für Hochschulleitungen: Wer priorisiert und investiert, steigt auf. Der Hinweis, die Profile seien „nicht als starre Typisierung“ zu verstehen, sondern „als Orientierung und Entwicklungstendenz“ (S. 28), ändert daran nichts. Im Gegenteil: Eine Orientierung, die eine Entwicklungsrichtung vorgibt, wird zum Maßstab. An ihm können sich Hochschulleitungen messen und messen lassen.

Einseitige Interpretation

Interpretieren heißt, über die Daten hinauszugehen. Das verpflichtet dazu, mehrere plausible Lesarten zu prüfen und gegeneinander abzuwägen. Der Bericht lässt durchweg nur eine Lesart zu: Wo etwas nicht eingesetzt wird, sieht er Unsicherheit, Zurückhaltung oder Rückstand. Dazu ein nur ein paar wenige Beispiele: (a) Dass KI an 37 % der Hochschulen in Prüfungsszenarien „bislang gar nicht verbreitet“ ist, „deutet auf bestehende Unsicherheiten hin“ (S. 18). (b) Überschriften wie „Potentiale der Digitalisierung werden nicht voll ausgeschöpft“ (S. 8), „KI zieht nach“ (S. 18) oder „Umsetzung bleibt hinter der Relevanzsetzung zurück“ (S. 20) unterstellen, dass mehr Verbreitung und Umsetzung das Ziel ist; nur vor diesem Hintergrund erscheint der gegenwärtige Stand als Rückstand. (c) Der Bericht erwägt kaum, dass eine Hochschule aus guten Gründen auf ein Szenario verzichten könnte. Andere Befunde werden aber durchaus vorsichtig gedeutet: Zum geringen Stellenwert von Wellbeing und Mental Health heißt es auf S. 9, das bedeute „nicht unbedingt, dass dieses Thema an den Hochschulen grundsätzlich weniger relevant ist“; beim Verzicht auf KI fehlt diese Vorsicht.

Fazit

Studien wie diese beschreiben nicht nur, sie haben eine Wirkung vor allem auf Hochschulleitungen. Das HFD ist eine gemeinsame Initiative von Stifterverband, CHE und HRK und wird vom BMFTR gefördert (S. 57); durchgeführt wurde die Befragung vom CHE (Einleitungstext Fragebogen). Seine Monitore haben Gewicht in Hochschulleitungen und Hochschulpolitik, und das Deutungsmuster ist bereits aus den Vorgängerstudien bekannt. Hier komme ich noch einmal auf die gebildeten Profile zurück: Diese taugen nicht als Grundlage für ein Ranking, suggerieren das aber, und allein das kann über die Verbreitung der Publikation eine Wirkung haben. Wie solche Vergleiche auf die Hochschulen zurückwirken, ist ein zentrales Thema der Rankingforschung (z.B. Brankovic, Hamann & Ringel, 2023). Profile wie „Zurückhaltende“ oder „Fortgeschrittene“ können Druck erzeugen, im nächsten Monitor eine Stufe höher zu stehen. So wird eine bestimmte Vorstellung guter Hochschulbildung als empirischer Befund präsentiert und Alternativen erscheinen als Rückstand. Wer potenziell eine solche Wirkung beim Thema KI und Hochschulbildung entfaltet, trägt Verantwortung. Dazu gehört: (1) die normativen Prämissen offenzulegen, statt die Studie als bloße Bestandsaufnahme darzustellen, (2) Antwortmöglichkeiten für bewusste Entscheidungen gegen einen Einsatz von KI vorzusehen und Fragen nach Gründen und Bedenken zu stellen, (3) methodische Begriffe und theoretische Konzepte präzise und sorgfältig zu verwenden, (4) Hochschulen nicht auf der Grundlage grober Durchschnittswerte einzustufen und ihnen keine Etiketten zu geben, die eine Haltung oder einen Entwicklungsstand unterstellen, (4) die Auswertung von Antworten in Freitexten nachvollziehbar zu dokumentieren, (5) bei der Interpretation auch die Lesarten zu prüfen, die nicht zur eigenen Agenda passen.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert