Künstliche Intelligenz ist im Alltag angekommen. Sie schreibt Texte, beantwortet Fragen und führt Gespräche. Das Herzstück dahinter sind Large Language Models (LLMs). Wie funktionieren Sprachmodelle wirklich, was passiert im Hintergrund und verstehen diese Systeme Sprache? Ich nehme dich Schritt für Schritt mit, zeige ihre Stärken, erkläre ihre Grenzen und mache die Technik greifbar.
Was ein Sprachmodell ist
Ein Sprachmodell ist kein denkendes Wesen. Es ist ein Rechenmodell, das versucht, das nächste Wort in einem Satz vorherzusagen.
Wenn du zum Beispiel schreibst:
„Der Himmel ist…“ …dann berechnet das Modell, welche Wörter wahrscheinlich folgen. Vielleicht „blau“, „klar“ oder „bewölkt“.
Es arbeitet mit Wahrscheinlichkeiten und erkennt durch unzählige Beispiele, welche Wörter häufig zusammen vorkommen. Genau daraus entsteht das Sprachgefühl, das heute so beeindruckend wirkt. Aber wichtig ist: Das Modell versteht Sprache nicht so, wie wir Menschen sie verstehen. Es erkennt Muster, keine Bedeutungen im menschlichen Sinn.
Wie aus Text Zahlen werden
Ein Modell sieht keine Wörter. Bevor irgendetwas passiert, wird dein Text in Tokens zerlegt. Ein Token ist ein Stück Text. Oft eine Silbe, manchmal ein ganzes Wort, manchmal nur ein Satzzeichen. „Düsseldorf“ zerfällt in mehrere Tokens, „und“ bleibt eines.
Jedes Token bekommt eine Nummer. Aus deinem Satz wird eine Zahlenreihe und mit dieser Zahlenreihe rechnet das Modell. Am Ende geht der Weg zurück. Aus Zahlen wird wieder Text.
Das erklärt zwei Dinge, die im Alltag auffallen. Englische Texte brauchen weniger Tokens als deutsche und kosten bei den meisten Anbietern deshalb weniger. Und ein Modell kann sich an einzelnen Buchstaben verrechnen, weil es Buchstaben gar nicht einzeln sieht. Die bekannte Frage, wie viele r in „strawberry“ stecken, scheitert genau daran.
Mehr dazu steht in Tokens, das Gedächtnis der KI.
Wie ein Computer Bedeutung speichert
Stell dir einen riesigen Raum voller Wörter vor. Wörter, die ähnlich verwendet werden, stehen nah beieinander – wie Freunde in einer Gruppe. „König“ steht neben „Königin“, „Arzt“ in der Nähe von „Krankenhaus“.
Wörter, die kaum etwas miteinander zu tun haben, stehen weit auseinander. In diesem Raum erkennt das Modell, welche Begriffe zusammenpassen. Es versteht Bedeutung über Zahlen und Abstände, nicht über Wissen oder Erfahrung.
Parameter, das Gedächtnis des Modells
Das Herz eines Sprachmodells bilden die Parameter. Das sind Zahlenwerte, die steuern, wie stark bestimmte Zusammenhänge gewichtet werden. Man kann sich das vorstellen wie ein riesiges Mischpult mit Milliarden Reglern. Jeder Regler steht für eine Verbindung zwischen zwei künstlichen Neuronen.
Während des Trainings werden diese Regler laufend angepasst – ein bisschen lauter, ein bisschen leiser – bis das Ergebnis möglichst gut passt. So entsteht das Sprachverständnis des Modells.
Große Modelle besitzen hunderte Milliarden Parameter. Sie speichern keine Wörter, sondern Beziehungen zwischen Begriffen. Wenn du so willst, sind Parameter für die KI das, was Synapsen für das menschliche Gehirn sind: Verbindungen, die durch Erfahrung gestärkt oder geschwächt werden – nur eben in Zahlenform.
Transformer, der Sprung von 2017
Der große Fortschritt in der KI-Forschung kam 2017 mit einer Technik namens Transformer. Früher konnten Maschinen nur Wort für Wort lesen. Transformer-Modelle betrachten alle Wörter gleichzeitig und erkennen so, welche zueinander gehören.
Ein Beispiel:
„Die Lehrerin nahm ihre Tasche, weil sie spät dran war.“
Das Modell erkennt, dass sich „sie“ auf „die Lehrerin“ bezieht.
Dieses Prinzip nennt man Self-Attention. Das Modell verteilt Aufmerksamkeit dorthin, wo sie gebraucht wird, und versteht dadurch den Satz als Ganzes. Diese Technik macht moderne Sprachmodelle so präzise.
Machine Learning, der größere Rahmen
Ein Sprachmodell ist kein eigenes Fach, sondern ein Fall von Machine Learning. Der Grundgedanke dahinter ist älter als jedes Sprachmodell. Ein Computer bekommt keine Regeln vorgeschrieben, sondern Beispiele und leitet die Regel selbst ab. Den Begriff prägte 1959 Arthur Samuel bei IBM, während er einem Programm Dame beibrachte.
Es gibt drei Arten, aus Beispielen zu lernen.
Überwachtes Lernen. Zu jedem Beispiel steht die richtige Antwort dabei. Tausende Bilder, jedes mit dem Vermerk Hund oder Katze. Das Modell rät, vergleicht, korrigiert sich.
Unüberwachtes Lernen. Es gibt keine richtigen Antworten. Das Modell sucht selbst nach Gruppen und Ähnlichkeiten, etwa nach Kundentypen in Bestelldaten.
Bestärkendes Lernen. Das Modell probiert etwas aus und bekommt dafür Belohnung oder Tadel. So lernen Programme Spiele und Roboter das Greifen.
Bei einem Sprachmodell kommt alles drei vor, nur in dieser Reihenfolge. Das Vortraining braucht keine Beschriftung, denn die richtige Antwort steht schon im Text: das nächste Wort. Der Feinschliff arbeitet überwacht mit von Menschen geschriebenen Beispielen. Und die letzte Runde läuft über Belohnung. Wie das im Einzelnen abläuft, steht gleich im nächsten Abschnitt.
Was beim Training passiert
Ein Modell entsteht in drei Schritten.
Vortraining. Das Modell liest riesige Textmengen und übt nichts anderes, als das nächste Token vorherzusagen. Hier entsteht das Sprachgefühl und hier steckt fast die gesamte Rechenzeit.
Feinschliff. Menschen schreiben Beispielantworten, das Modell lernt daraus, wie eine hilfreiche Antwort aussieht. Aus einem Textfortsetzer wird ein Gesprächspartner.
Rückmeldung. Menschen bewerten Antworten als besser oder schlechter und das Modell wird in Richtung der besseren gezogen. Dieser Schritt heißt Reinforcement Learning from Human Feedback, kurz RLHF. Er entscheidet, wie höflich, wie vorsichtig und wie ausführlich ein Modell antwortet.
Wer ein fertiges Modell auf seinen eigenen Ton bringen will, hängt einen vierten Schritt an. Das ist Fine-tuning.
Warum Sprachmodelle keine Faktenmaschinen sind
Trotz ihrer Leistungsfähigkeit wissen Sprachmodelle nichts. Sie haben kein Gedächtnis, keine Meinung und kein Verständnis im menschlichen Sinn. Sie erzeugen Texte, die wahrscheinlich richtig klingen, aber nicht zwingend wahr sind.
Manchmal erfinden sie Dinge, die gar nicht existieren. Das nennt man Halluzination. Das Modell schließt eine Wissenslücke, indem es etwas ergänzt, das nur wahrscheinlich klingt.
Deshalb gilt: Jede Information aus einem LLM muss geprüft werden. Das Modell kann täuschen, ohne es zu wollen. Nur durch unseren Faktencheck wird aus einer guten Formulierung eine verlässliche Aussage.
Warum dieselbe Frage verschiedene Antworten bringt
Das Modell rechnet für jedes nächste Token Wahrscheinlichkeiten aus. Es nimmt aber nicht immer die höchste. Es würfelt in dem Rahmen, den diese Wahrscheinlichkeiten vorgeben.
Wie stark gewürfelt wird, steuert ein Wert namens Temperatur. Niedrige Temperatur heißt: nimm fast immer das Wahrscheinlichste. Die Antworten werden gleichförmig und vorhersagbar. Hohe Temperatur heißt: lass auch unwahrscheinliche Wörter zu. Die Antworten werden bunter und riskanter.
Deshalb bekommst du auf dieselbe Frage zweimal verschiedene Antworten. Das ist kein Fehler, das ist der Aufbau.
Das Kontextfenster, das kurze Gedächtnis
Ein Sprachmodell erinnert sich nicht an gestern. Was es weiß, steht im Kontextfenster, also in den Tokens, die bei dieser einen Anfrage vor ihm liegen. Deine Frage gehört dazu, der bisherige Verlauf und alles, was das System sonst hineinschreibt.
Ist das Fenster voll, fällt vorne etwas heraus. Genau dann wirkt ein Modell plötzlich vergesslich. Frühe Modelle kamen auf ein paar tausend Tokens, heutige auf hunderttausende. Größer ist trotzdem nicht automatisch besser, denn in der Mitte langer Eingaben lässt die Treffsicherheit nach.
Wissen, das dauerhaft verfügbar sein soll, gehört deshalb nicht ins Fenster, sondern in eine Quelle, die bei jeder Anfrage durchsucht wird. Das ist RAG. Wie groß ein Modell selbst ist, steht übrigens in seinem Namen: 3B, 8B oder 175B.
Wie sich Fehler vermeiden lassen
Sprachmodelle sind stark, wenn sie wissen, was du von ihnen willst. Die meisten Fehler entstehen, weil die Aufgabe zu offen oder unklar formuliert ist. Ich habe mir ein paar einfache Gewohnheiten angewöhnt, die helfen, verlässliche Ergebnisse zu bekommen:
Ich formuliere präzise Aufgaben – statt „Erklär Embeddings“ schreibe ich zum Beispiel „Beschreibe Embeddings in einem Satz, so dass es ein Schüler versteht“.
Ich gebe Beispiele oder Stilhinweise, damit das Modell weiß, welchen Ton ich möchte.
Ich achte auf klare Faktenfragen und bitte das Modell, Quellen zu nennen oder zu erklären, warum eine Aussage stimmt.
Wenn es kreativ werden soll, halte ich die Anweisung bewusst offener.
Und ich prüfe jedes Ergebnis. Ich lese nach, vergleiche Zahlen und überprüfe Aussagen, bevor ich sie übernehme.
So wird aus einer guten KI-Antwort ein solider Text. Das Modell liefert Tempo und Struktur, ich sorge für Wahrheit und Kontext. Erst zusammen entsteht Qualität.
Wo LLMs wirklich stark sind
Sprachmodelle sind hervorragend darin, Texte zu strukturieren, Ideen zu entwickeln und komplizierte Themen verständlich zu erklären. Sie helfen beim Schreiben, beim Ordnen von Gedanken und beim Finden neuer Formulierungen.
Ein LLM ist kein Ersatz für menschliches Denken, sondern eine Unterstützung, die Rechenleistung mit Kreativität verbindet und dadurch Neues möglich macht.
Welche LLMs es gibt und wie sie sich unterscheiden
LLM steht für Large Language Model, also großes Sprachmodell. Groß meint die Zahl der Parameter und die Menge der Trainingstexte. Bekannt sind vor allem diese Familien.
GPT von OpenAI ist die Reihe hinter ChatGPT und für viele Menschen das Gesicht der ganzen Technik. Claude von Anthropic ist stark bei langen Dokumenten und beim Arbeiten mit Code. Gemini von Google steckt in der Suche und in den Büroprogrammen. Diese drei laufen nur bei ihren Anbietern, die Gewichte bleiben unter Verschluss.
Daneben stehen die offenen Modelle. Llama von Meta ist die bekannteste Familie und Grundlage für unzählige eigene Projekte. Mistral kommt aus Frankreich und ist für seine kleinen, schnellen Modelle bekannt. Dazu kommen Qwen und DeepSeek aus China. Ihre Gewichte kann man herunterladen und auf dem eigenen Rechner starten, zum Beispiel lokal mit Ollama.
Die Versionsnummern wechseln im Monatstakt und jede Rangliste ist nach ein paar Wochen veraltet. Stabiler sind die drei Fragen, die wirklich unterscheiden. Läuft das Modell bei einem Anbieter oder bei dir? Wie groß ist es, siehe 3B, 8B oder 175B? Und ist es allgemein gehalten oder mit Fine-tuning auf eine Aufgabe zugeschnitten?
Gehirn und Sprachmodell im Vergleich
Der Vergleich wird oft gezogen und er führt in die Irre, sobald man ihn wörtlich nimmt.
| Mensch | Sprachmodell | |
|---|---|---|
| Lernen | aus wenigen Beispielen | aus Milliarden von Texten |
| Energie | rund 20 Watt | Rechenzentrum, das Training von GPT-3 lag bei rund 1.287 Megawattstunden |
| Gedächtnis | erinnert sich an gestern | nur das Kontextfenster |
| Bedeutung | verbindet Wörter mit Erfahrung | verbindet Wörter mit Zahlen |
| Irrtum | merkt die eigene Unsicherheit | klingt auch im Irrtum sicher |
Ein Sprachmodell ist keine kleine Version eines Gehirns. Es ist etwas anderes, das an der Oberfläche ähnlich aussieht.
Wie ein LLM arbeitet, kurz erklärt
- Training: Das Modell lernt, das nächste Wort vorherzusagen, basierend auf riesigen Textmengen.
- Parameter: Zahlenwerte, die steuern, wie stark bestimmte Muster gewichtet werden.
- Bedeutungsraum: Zahlen, die darstellen, wie ähnlich Wörter inhaltlich sind.
- Self-Attention: Die Fähigkeit, Zusammenhänge im Satz zu erkennen.
- Textausgabe: Das Modell erzeugt Text Wort für Wort, in Echtzeit.
Häufige Fragen
Was ist ein Sprachmodell in einem Satz?
Ein Rechenmodell, das aus sehr vielen Texten gelernt hat, welches Token als nächstes wahrscheinlich ist, und das daraus Wort für Wort eine Antwort baut.
Denkt ein Sprachmodell?
Nein. Es hat keine Absicht, keine Meinung und kein Weltbild. Es erkennt Muster in Sprache und setzt sie fort. Dass die Ergebnisse wie Denken aussehen, sagt mehr über Sprache aus als über die Maschine.
Was unterscheidet es von einer Suchmaschine?
Eine Suchmaschine zeigt dir Fundstellen und du entscheidest. Ein Sprachmodell formuliert eine Antwort und verrät dir nicht, woher sie stammt. Beides ist nützlich, aber nur eines davon ist überprüfbar.
Warum erfindet es Quellen?
Weil eine erfundene Quelle genauso wahrscheinlich klingt wie eine echte. Das Modell unterscheidet nicht zwischen wahr und plausibel. Es kennt nur wahrscheinlich.
Fazit
Ein Large Language Model ist keine Maschine, die denkt oder fühlt. Es ist ein Rechensystem, das Sprache über Wahrscheinlichkeiten versteht. Es analysiert Muster und verwandelt sie in Text.
Seine Stärke liegt in der Verbindung von Statistik und Bedeutung. Seine Grenze liegt dort, wo Wissen und Wahrheit beginnen. Wenn wir beides zusammenbringen – die Präzision der Maschine und das Urteilsvermögen des Menschen – entsteht ein Werkzeug, das unsere Sprache erweitert und unsere Ideen beflügelt.
Wenn du selbst mit KI arbeitest oder Texte schreibst, experimentiere ruhig mit klaren Aufgaben und Beispielen. Je genauer du beschreibst, was du willst, desto besser werden die Ergebnisse. Und wenn du verstehen willst, wie Sprachmodelle funktionieren, bleib dran – ich schreibe hier regelmäßig über KI, Kreativität und digitale Kultur.
Wenn du noch tiefer einsteigen willst: Im KI Glossar findest du alle Grundlagen kompakt erklärt.
Quellen
- Vaswani et al., „Attention Is All You Need“ (arXiv 1706.03762, 2017): die Arbeit, mit der die Transformer-Architektur vorgestellt wurde
- Ouyang et al., „Training language models to follow instructions with human feedback“ (arXiv 2203.02155, 2022): zum Feinschliff und zur Rückmeldung durch Menschen
- Patterson et al., „Carbon Emissions and Large Neural Network Training“ (arXiv 2104.10350, 2021): zum Energiebedarf beim Training großer Modelle


Schreibe einen Kommentar