Alchimedus

Webinar

HAUS
ORDNUNG

Während wir auf die anderen Teilnehmer warten, gibt es einige Regeln und Hinweise, die zu beachten sind.

1

Schalten Sie die Kamera und das Mikrofon aus.

2

Gerne können Sie Ihre Fragen in das Chatfeld eingeben.

3

Im Anschluss an die Präsentation findet eine Fragerunde statt.

4

Die Präsentation wird aufgezeichnet.

5

Verbot von eigenen Aufzeichnungen:

Das Anfertigen von Aufzeichnungen jeglicher Art ist nicht gestattet. Dies dient dem Schutz des geistigen Eigentums und der Wahrung der Privatsphäre aller Anwesenden.

Speaker

Wer bin ich?

Daniel Leuverink

Daniel Leuverink

KI-Architekt & Geschäftsführer der AllBytes GmbH

Seit 2006 — gestartet zur Fußball-WM in Deutschland

15 Softwareentwickler · Fokus: KMU · Individuelle Software nach Maß

Spezialisierung: Enterprise KI-Architektur & Prozessautomatisierung

Referenzen

Stahlgruber Meggle Bauer Hoval Develey BabyWalz

"Wir sind keine Marketingagentur. Keine Designer. Keine Texter.
Wir sind Techies — und wir bauen KI, die wirklich funktioniert."

Überblick

Was uns heute erwartet

01

Was ist KI?

KI, maschinelles Lernen, Deep Learning — und wo das LLM sitzt

02

Eine kurze Geschichte

Seit wann gibt es KI — und warum gerade jetzt?

03

Wie ein LLM funktioniert

Vom Lernen übers neuronale Netz bis zur Wortvorhersage

04

Grenzen & Einsatz

Halluzinationen, Aktualität — und wie die KI zu euch kommt

05

Modelle vergleichen: Benchmarks

Woran misst man, wie gut ein LLM ist?

Dies ist ein Einführungsvortrag — gedacht als Einstieg, um zu verstehen, wie KI im Kern funktioniert und warum sie so arbeitet, wie sie arbeitet.

AllBytes GmbH

AllBytes GmbH präsentiert

Large Language Models

Was steckt hinter ChatGPT, Claude & Co.?

„Keine Magie. Nur Mathematik."

Daniel Leuverink  ·  KI-Architekt  ·  AllBytes GmbH Alchimedus Webinar

Was ist KI überhaupt?

„KI" ist ein Überbegriff — klick dich Stufe für Stufe nach innen

Künstliche Intelligenz

Maschinelles Lernen

Deep Learning

Generative KI

LLM · Bild-KI · Audio-KI

die konkreten Werkzeuge

Stufe / 5

Stufe 1 / 5

Künstliche Intelligenz

Der Oberbegriff: Maschinen übernehmen Aufgaben, für die man sonst menschliche Intelligenz braucht. Dazu zählt auch ältere KI mit festen Regeln — die lernt nicht, sie folgt Vorgaben.

Regelbasierte Systeme Schachcomputer Navigation

Stufe 2 / 5

Maschinelles Lernen

KI, die aus Beispielen lernt, statt fest programmiert zu werden. Sie erkennt Muster in Daten.

Spam-Filter Absatzprognose Empfehlungen Betrugserkennung

Stufe 3 / 5

Deep Learning

Maschinelles Lernen mit neuronalen Netzen aus vielen Schichten. Stark bei komplexen Daten wie Bildern, Sprache und Text.

Bilderkennung Spracherkennung Übersetzung

Stufe 4 / 5

Generative KI

Deep-Learning-Modelle, die etwas Neues erzeugen — Text, Bilder, Audio — statt nur einzuordnen.

Texte Bilder Stimmen Musik

Stufe 5 / 5

LLM · Bild-KI · Audio-KI

Die konkreten Werkzeuge. Das LLM ist auf Sprache spezialisiert — daneben gibt es Bild- und Audio-KI.

💬

LLM — ChatGPT, Claude (Text)

🖼️

Bild-KI — Midjourney, DALL·E

🔊

Audio-KI — Stimmen, Musik

Hier sind wir heute → LLMs

KI ist der Werkzeugkasten — das LLM ist ein Werkzeug darin.

Seit wann gibt es KI — und warum jetzt?

Dieselben Stufen wie eben — jede kam zu ihrer Zeit dazu.

1956

Künstliche Intelligenz entsteht

Der Begriff wird auf der Dartmouth-Konferenz geprägt. Die erste KI folgt festen Regeln — sie lernt noch nicht selbst.

Regelbasierte SystemeSchachcomputer
ab ~1990er

Maschinelles Lernen wird praktisch

Statt fester Regeln lernt die KI jetzt aus Daten und erkennt Muster. Viele Alltagshelfer entstehen.

Spam-FilterEmpfehlungenPrognosen
2012

Deep Learning schlägt durch

Neuronale Netze machen einen Sprung: KI erkennt erstmals zuverlässig, was auf Bildern zu sehen ist.

BilderkennungSpracherkennung
ab 2017

Generative KI nimmt Fahrt auf

Eine neue Technik, der „Transformer", macht KI möglich, die selbst Neues erzeugt — Texte und Bilder.

Texte erzeugenBilder erzeugen
2022

LLMs & Bild-KI für alle

Mit ChatGPT wird KI per Sprache bedienbar — kein Technik-Wissen mehr nötig. Der Durchbruch in der Breite.

ChatGPTMidjourney
Heute

KI-Agenten

KI, die nicht nur antwortet, sondern selbst Aufgaben erledigt. Genau darum geht es heute Nachmittag in Modul 3.

Aufgaben automatisiereneigenständig handeln
Warum gerade jetzt? 📊 Daten — das ganze Internet ⚡ Rechenleistung — schnelle Grafikchips 🔧 Transformer — der Technik-Sprung (2017)

Klick oder → für den nächsten Punkt · / 6

Chronologie: 1956 ~1990er 2012 · Deep Learning 2017 2022 Heute

Wie ein neuronales Netz funktioniert

Drei Schichten: InputHidden LayerOutput

Input-Schicht

🐱

Das Bild → Zahlen (Pixel)

Hidden Layer

gewichten & kombinieren

Output-Schicht

🐱 Katze
🐕 Hund

Input-Schicht: Das Bild wird in viele kleine Zahlen zerlegt — jedes Pixel ein Eingangssignal. Das ist alles, was das Netz „sieht".

Hidden Layer: Hier passiert die eigentliche Arbeit. Die Signale werden gewichtet und kombiniert. Mehrere solcher Schichten hintereinander = „Deep" Learning.

1. Durchlauf: Das untrainierte Netz rät — und liegt daneben: „Hund". Logisch, es hat ja noch nichts gelernt.

Jetzt trainieren wir: Bei jedem Fehler werden die Gewichte im Hidden Layer nachjustiert. Starte den Lauf und schau dem Hidden Layer oben zu.

2. Durchlauf — nach dem Training: Jetzt erkennt das Netz die Katze. Richtig!

Und wie haben wir trainiert? Mit unzähligen beschrifteten Beispielen — und die kommen oft von uns allen.

Genauigkeit: Der Hidden Layer oben ordnet sich neu — die Gewichte ändern sich.

Die Beispiele kommen oft von uns allen.

„Wählen Sie alle Bilder mit Ampeln aus." Jedes gelöste Google reCAPTCHA, jedes Foto-Tag, jede Korrektur liefert beschriftete Beispiele — wir alle haben mitgeholfen, KI schlau zu machen.

Schritt / 6
Chronologie: 1956 ~1990er 2012 · Deep Learning 2017 2022 Heute

Level 1: Addition lernen

Die KI soll die Formel a + b = c entdecken

Iterationen: Genauigkeit:
Chronologie: 1956 ~1990er 2012 · Deep Learning 2017 2022 Heute

Level 3: Gewichtete Summe

Die KI soll die Formel a × 3 + b × 2 = c entdecken

Iterationen: Genauigkeit:

So funktionieren neuronale Netze wirklich: Die Gewichte w1 und w2 passen sich an, bis sie die Zielwerte (3 und 2) entdeckt haben.

Chronologie: 1956 ~1990er 2012 2017 2022 · LLMs Heute

Token-Wahrscheinlichkeiten

LLMs sind Vorhersagemaschinen - sie "raten" das nächste Wort

"Es war einmal..."

Temperatur steuert Kreativität vs. Vorhersagbarkeit

So entsteht ein ganzer Satz:

Prompt: "Erkläre mir KI in einem Satz."

Jeder Token wird einzeln vorhergesagt - basierend auf allen vorherigen Wörtern!

Das Wichtigste in Kürze

🎲

Wahrscheinlichkeiten, keine Fakten

KI "würfelt" basierend auf Trainingsdaten

🌡️

Temperatur = Kreativität

Niedrig = vorhersagbar, Hoch = kreativ

🔗

Token für Token

Jedes Wort beeinflusst das nächste

Halluzinationen — „Trust but Verify"

Die KI lügt nicht — sie erfindet Plausibles. Das Tückische: es klingt perfekt.

Warum erfindet KI Dinge?

Sie rät das nächste Wort — Ziel ist flüssiger Text, nicht Wahrheit.

Sie sagt fast nie „weiß ich nicht" — sie füllt Lücken mit etwas Plausiblem.

Kein echtes Faktengedächtnis; ihr Wissen kann veraltet sein.

Bei dünner Datenlage erfindet sie Details einfach dazu.

Beispiel — Antwort der KI

„Das Balance-Pad „FlexPro“ erfüllt die Sportgeräte-Norm DIN EN 9836, wiegt 1,2 kg und wurde 2019 vom Fraunhofer-Institut getestet."
Alles frei erfunden. Norm, Gewicht und Test gibt es so nicht — klingt aber fachlich und überzeugend.

Das Tückische: Die Antwort ist grammatikalisch perfekt, selbstbewusst und fachlich formuliert — deshalb fällt der Fehler in unserer Sprache gar nicht auf. Genau deshalb: Trust but Verify — wichtige Fakten immer prüfen.

Die KI kennt eure Live-Daten nicht

Grenze 2: Aktualität & Wissensstand

Wissen bis zum Stichtag

Ein Modell wurde bis zu einem bestimmten Zeitpunkt trainiert. Was danach passiert, weiß es nicht von selbst — es sei denn, man gibt ihm die Information mit.

Kennt euer Geschäft nicht

  • • Eure aktuellen Preise & Aktionen
  • • Lagerbestände & Verfügbarkeit
  • • Amazon-Ranking von heute
  • • Neue Produkte im Sortiment

Gut zu wissen: Genau das lässt sich lösen — indem man der KI eure Daten gezielt mitgibt oder anbindet. Mehr dazu in Modul 3 & 4.

Modelle vergleichen: Benchmarks

Woran misst man, wie gut ein LLM ist?

Logik

schlussfolgern, Probleme lösen

Wissen

Fakten aus vielen Bereichen

Programmieren

Code schreiben & verstehen

Sprache

schreiben, übersetzen

Mathematik

rechnen, exakte Logik

Kontextlänge

wie viel gleichzeitig „im Kopf"

Geschwindigkeit

wie schnell die Antwort kommt

Kosten

Preis pro Anfrage

Wo schaut man nach? — Zwei wichtige Seiten

LMArena (Chatbot Arena)

Echte Menschen vergleichen zwei anonyme Antworten und wählen die bessere → Elo-Rangliste. Zeigt, was Nutzer tatsächlich bevorzugen.

lmarena.ai

Artificial Analysis

Vergleicht Modelle nach Intelligenz, Geschwindigkeit & Preis mit standardisierten Tests. Gut für die nüchterne Auswahl-Entscheidung.

artificialanalysis.ai

Kein Modell gewinnt überall — das beste hängt von der Aufgabe ab. Faustregel: mit der eigenen Aufgabe testen.

Benchmark · Gesamtwert

Intelligence Index

Was wird getestet?

Kein Einzeltest, sondern der Durchschnitt aus ~9 Benchmarks (Wissenschaft, Mathe, Coding, Wissen …) — zusammengefasst zu einer Zahl für die „Gesamt-Klugheit" eines Modells.

So funktioniert's

Ein Modell erzielt in den 9 Einzeltests unterschiedliche Werte → daraus wird ein gewichteter Gesamtscore gebildet. Praktisch für den schnellen Überblick „wer ist insgesamt vorn".

Aktuelle Rangliste · Stand 16.06.2026

1.Claude Fable 5 60
2.Claude Opus 4.8 56
3.GPT-5.5 55

Quelle: Artificial Analysis · Werte ändern sich laufend

Benchmark · Wissenschaft

GPQA Diamond

Was wird getestet?

Sehr schwere naturwissenschaftliche Fragen auf Experten-/Promotions-Niveau (Physik, Chemie, Biologie) — bewusst so hart, dass Laien selbst mit Google scheitern.

Beispiel (sinngemäß)

„Welches stabile Edelgas hat bei Raumtemperatur die höchste Dichte?"

A) Helium B) Argon C) Krypton D) Xenon ✓

Aktuelle Rangliste · Stand 16.06.2026

1. Gemini 3.1 Pro 94,1 %
2. MiniMax M3 92,9 %
3. Claude Fable 5 92,6 %

Quelle: Artificial Analysis · Werte ändern sich laufend

Benchmark · Mathematik

AIME

Was wird getestet?

Anspruchsvolle Wettbewerbs-Mathematik (Olympiade-Niveau). Die Antwort ist immer eine ganze Zahl von 000–999 — kein Multiple-Choice, man muss wirklich rechnen.

Beispiel (sinngemäß)

„Wie viele dreistellige Zahlen sind durch 7 teilbar?" → Antwort: 128

Aktuelle Lage · Stand 16.06.2026

Praktisch gelöst — Spitzenmodelle erreichen ~100 % (z. B. GPT-5.2 Pro). Wettbewerbs-Mathe ist „gesättigt" und unterscheidet kaum noch.

Quelle: Artificial Analysis / llm-stats · Werte ändern sich laufend

Benchmark · Agentisches Coding

Terminal-Bench

Was wird getestet?

Die KI muss echte Programmier-Aufgaben eigenständig im Terminal lösen — Befehle ausführen, Dateien ändern, Tests laufen lassen. Die agentische Königsdisziplin.

Beispiel (sinngemäß)

Aufgabe: „Finde den Fehler, der den Test rot macht, behebe ihn und lass alle Tests grün durchlaufen." → Die KI arbeitet selbstständig über mehrere Schritte.

Aktuelle Rangliste · Stand 16.06.2026

1. GPT-5.4 57,6 %
2. Claude Opus 4.7 54,5 %
3. Gemini 3.1 Pro 53,8 %

Noch viel Luft nach oben (~57 %) — hier trennt sich die Spreu vom Weizen.

Quelle: Artificial Analysis / PricePerToken · Werte ändern sich laufend

Benchmark · Allgemein- & Fachwissen

MMLU-Pro

Was wird getestet?

Tausende Multiple-Choice-Fragen quer durch ~14 Fachgebiete (Jura, Medizin, BWL, Technik …), je rund 10 Antwortmöglichkeiten.

Beispiel (sinngemäß)

„In welchem Jahr trat die EU-Datenschutz-Grundverordnung (DSGVO) in Kraft?" → 2018 (aus ~10 Optionen)

Aktuelle Lage · Stand 16.06.2026

> 90 % bei praktisch allen Top-Modellen → der Test ist „gesättigt" und unterscheidet die Spitze kaum noch.

Quelle: Artificial Analysis · Werte ändern sich laufend

Benchmark · Generative Medien

Benchmarks für Bild, Video & Stimme

Nicht nur Text — auch Bild-, Video- und Audio-KI werden verglichen

Text → Bild

Bilder erzeugen

Bildbearbeitung

Bilder per Text ändern

Text/Bild → Video

Clips erzeugen

Text → Stimme

Sprachausgabe

So wird gemessen

Hier gibt es kein „richtig". Deshalb: gleicher Prompt → zwei Ergebnisse → Menschen wählen blind das bessere → daraus eine Elo-Rangliste (wie bei LMArena). Dazu: Geschwindigkeit & Preis.

Der Unterschied zu Text

Text-Benchmarks (GPQA, AIME …) haben eine objektive Lösung — richtig oder falsch. Bild/Video/Stimme sind Geschmackssache → es zählt das menschliche Urteil.

Quelle: Artificial Analysis (eigene Arenas für Bild, Video & Sprache) · Werte ändern sich laufend

Benchmark · Live-Fragen

Aktuelles Wissen

Was wird getestet?

Fragen, deren Antwort sich ständig ändert (Wetter, Ergebnisse, News). Ein reines LLM kann das nicht (Wissensstand endet am Stichtag) — es braucht Websuche/Tools. Benchmark FreshQA stellt solche „schnell-änderenden" Fragen, wöchentlich aktualisiert.

Beispiele

🌦️

„Wie ist das Wetter aktuell in München?" — ohne Suche: geraten · mit Suche: Live-Wert

„Wie ist das Fußballspiel gestern ausgegangen?" — ohne Suche: erfunden · mit Suche: echtes Ergebnis

Aktuelle Rangliste (mit Websuche) · Stand 15.06.2026

1. Claude Opus 4.6 (Suche) 1252
2. GPT-5.5 (Suche) 1240
3. Claude Fable 5 1237

Gemessen wird „Modell + Suche" — nicht das reine LLM. (Search Arena, Elo)

Quelle: arena.ai Search Arena · FreshQA · Werte ändern sich laufend

Was ihr jetzt über KI wisst

🧠

Ein LLM ist ein sehr guter Vervollständiger — es berechnet das wahrscheinlich nächste Wort.

✍️

Stark bei Sprache & Struktur: Texte, Zusammenfassen, Übersetzen, Ideen.

⚠️

Grenzen kennen: Halluzinationen & Aktualität — und gegensteuern.

🔒

Sicher einsetzbar mit dem richtigen Setup — dafür ist AllBytes da.

Vielen Dank

Bleiben wir in Kontakt

Und jetzt? Lasst uns ins Gespräch kommen — Fragen, Ideen oder ein eigenes KI-Projekt? Meldet euch gerne.

Daniel Leuverink

KI-Architekt & Geschäftsführer · AllBytes GmbH

E-Mail

dleuverink@allbytes.de

Telefon

+49 (0) 8071 / 10 98 066

Website

www.allbytes.de

LinkedIn

linkedin.com/in/daniel-leuverink-543014271

Über Feedback freue ich mich riesig! Jede Rückmeldung hilft.

Die KI-Vortragsreihe bei Alchimedus

heute Teil 1

Large Language Models — dieser Vortrag · Sie sind hier

Do 02.07.

Wissensmanagement mit KI — RAG & „Zweites Gehirn"

Di 07.07.

KI-Tools für Content & Marketing — Videos, Bilder, Social Media, digitale Avatare

Do 16.07.

Agentic Systems: Wenn KI selbständig handelt — Agent Coding, Praxisbeispiele

Jeweils 2026 · Anmeldung & Infos über Alchimedus

Chronologie: 1956 ~1990er · Maschinelles Lernen 2012 2017 2022 Heute

So lernt ein Spamfilter

Maschinelles Lernen in der Praxis — Schritt für Schritt

Schritt 1

Viele Beispiele zeigen

Wir geben dem System tausende E-Mails, die schon beschriftet sind — Spam oder kein Spam. Es bekommt keine Regeln, nur Beispiele.

📧

Spam

tausende Beispiele

📧

Kein Spam

tausende Beispiele

Schritt 2

Signale gewichten

Das System schaut auf Signale — Wörter, Absender, Links — und gibt jedem ein Gewicht: Wie stark spricht es für Spam?

„Gewinn garantiert"Spam ▲
Viele Linkseher Spam
Absender bekanntkein Spam ▼

Schritt 3

Raten & korrigieren

Bei jedem Beispiel rät es, vergleicht mit dem richtigen Etikett und dreht bei Fehlern die Gewichte nach. Tausende Male — bis es kaum noch danebenliegt. (Genau wie bei Katze/Hund.)

🤖

raten

Fehler

🎯

Gewichte nach

Schritt 4

Im Einsatz

Neue Mail rein → Spam-Wert berechnen → über der Schwelle landet sie im Spam-Ordner. Und klickst du selbst „Spam", lernt es weiter.

Neue E-Mail

92%

Spam-Wahrscheinlichkeit

ab in den Spam-Ordner

Kein Mensch schreibt die Regeln — die KI lernt sie aus Beispielen.

Klick oder → für den nächsten Schritt · / 4

Chronologie: 1956 ~1990er 2012 2017 · Transformer 2022 Heute

Der Durchbruch: „Attention"

Wie die KI lernt, worauf es im Satz ankommt

Der Pokal passt nicht in den Koffer, weil er zu ist.

„er" bezieht sich auf →

Ein einziges Wort — „groß" oder „klein" — entscheidet, worauf sich „er" bezieht. Der Transformer (2017) schaut auf alle Wörter gleichzeitig und „achtet" auf die wichtigen. Das nennt man Attention — die Grundlage aller heutigen Sprachmodelle.

Wie kommt die KI zu euch?

Vom Training übers Rechenzentrum bis zu eurer Anfrage

🏭

Hersteller

OpenAI, Anthropic, Google …

🧠 LLM

wird trainiert …

✓ Modell fertig

deploy →
🖥️

Server

Rechenzentrum

🧠 LLM

(noch leer)
Anfrage ⇄ Antwort
📱

Dein Gerät

Handy / PC

Frage:

„Schreib mir einen Produkttext …"

wartet

1. Training: Der Hersteller trainiert das LLM mit riesigen Datenmengen. Das dauert Wochen, kostet Millionen — und passiert nur einmal.

2. Deploy: Das fertige Modell wird auf leistungsstarke Server gestellt (Rechenzentrum). Dort läuft es und wartet auf Anfragen.

3. Anfrage & Antwort: Ihr tippt am Handy oder PC eine Frage. Sie geht zum Server, dort rechnet das LLM die Antwort — und schickt sie zurück. Das Modell läuft nicht auf eurem Gerät.

Schritt / 3
/