Tag 12: Bildgenerierung & visuelle KI
← Zurück
Modul 1 Ausgewertet M1-T12 M1-W3-T12

Tag 12 von 60 · Modul 1, Woche 3

Tag 12: Bildgenerierung & visuelle KI

01. September 2026 · · Folien einzeln ansehen
KI ist multimodal – sie versteht nicht nur Text, sondern auch Bilder, Audio, Video und Daten.
Entwurf, noch nicht freigegeben

Ziele

Grobziel Modul 1

Teilnehmende nutzen KI wirksam, sicher und eigenverantwortlich für die eigene Arbeit und entwickeln einen reflektierten persönlichen Standpunkt dazu.

Tagesziele

  • TN können erklären, was Multimodalität bedeutet – und verschiedene Eingabeformen nennen, die KI verarbeiten kann.
  • TN können Bilder mithilfe von KI und dem Tool „Magnific“ generieren, ohne den Markt mit noch mehr „AI Slop“ zu fluten.
  • TN haben einen professionellen Prompt im Gepäck, mit dem sie verschiedene Tonalitäten analysieren können.
  • Der Horizont der TN für KI-Anwendungsfälle ist über das Bearbeiten von Text-zu-Text hinausgewachsen.

Tagesablauf

einstieg Einstieg: Checkpoint & Wiederholung
theorie Multimodalität – Wiederholung und Vertiefung
expertenvortrag Expertenvortrag Teil 1 (Marc Elsner): Token-Kosten & Reasoning
praxisübung Praxis: Bild-KI gemeinsam mit Marc erleben
praxisübung Praxis: Bild-Promptgenerator
abschluss Tagesabschluss & Ausblick

Kursplan

Zeit
Block
Methode
Werkzeug
Ziel
09:00–09:15
Einstieg: Checkpoint & Wiederholung
einstieg
09:15–10:05
Multimodalität – Wiederholung und Vertiefung
theorie
10:05–12:00
Expertenvortrag Teil 1 (Marc Elsner): Token-Kosten & Reasoning
expertenvortrag
12:30–14:00
Praxis: Bild-KI gemeinsam mit Marc erleben
praxisübung
Claude
14:00–15:30
Praxis: Bild-Promptgenerator
praxisübung
Langdock (Nano Banana)
15:30–16:15
Tagesabschluss & Ausblick
abschluss

Blöcke im Detail

Block 1 einstieg 09:00–09:15 Einstieg: Checkpoint & Wiederholung

Plenum · 2 Min.

  1. Recap Tag 11: Automatisierungsspektrum, Systemprompt, Skills, Quick Wins, Projekt/Assistent/Agent
  2. KI-News der Woche: Gesehen, Ausprobiert, Beobachtet, je max. 1–2 Min. pro Person
Block 2 theorie 09:15–10:05 Multimodalität – Wiederholung und Vertiefung

  1. Modalitäten-Landkarte: Text/Bild/Audio/Daten als Ein- und Ausgabe
  2. Beispiele je Modell-Anwendung: Text-to-Image, Image-to-Text, Image-to-Video, Text-to-Video, Image-to-Image, Text-to-Data, Data-to-Text
  3. Vier Berufsanwendungsfälle: Dashboard-Screenshot analysieren, Tabellen auswerten, Sprachnotiz strukturieren, Video transkribieren
Block 3 expertenvortrag 10:05–12:00 Expertenvortrag Teil 1 (Marc Elsner): Token-Kosten & Reasoning

  1. Token-Kosten-Modell: Text günstig, Bild/PDF/PPT seitenweise teurer, Video am teuersten, Video+Audio am teuersten
  2. Reasoning multipliziert den Token-Verbrauch. Faustregel: nur einsetzen, wenn nötig
  3. Spar-Tipp: PDF/PPT einmalig analysieren, Ergebnis als Markdown speichern, künftig nur noch die .md-Datei verwenden
Block 4 praxisübung 12:30–14:00 Praxis: Bild-KI gemeinsam mit Marc erleben

Claude

  1. Pressemitteilung von bundesregierung.de holen
  2. Stilanalyse-Prompt (7 Dimensionen) in Claude mit dem Text ausführen
  3. Ergebnis auswerten: wie lässt sich der Leitfaden für eigene Texte nutzen?
  4. Bonus: Claude einen neuen Text im analysierten Stil schreiben lassen und prüfen
Block 5 praxisübung 14:00–15:30 Praxis: Bild-Promptgenerator

Langdock (Nano Banana)

  1. Eigene Bildidee kurz auf Deutsch beschreiben
  2. Promptbot (Prompt Pyramide, 8 Dimensionen) in Langdock generieren lassen
  3. Generierten Prompt in Nano Banana testen und mit der eigenen Vorstellung vergleichen
  4. Bonus: Variante mit eigenem Foto (z. B. Produktbild oder Portrait) ausprobieren
Block 6 abschluss 15:30–16:15 Tagesabschluss & Ausblick

Keine weiteren Details für diesen Block.

Verwendete Elemente

Deliverables

Tools

  • Claude
  • Langdock
  • Nano Banana
  • Magnific
  • Flux
  • Seedream
  • MS Copilot

Links

Rahmen dieses Tages

titelfoliecode-of-knowledge-transferreferenten-vorstellungcheckpoint-wiederholunglernzieletagesplanblock-dividerdas-nehmen-wir-mitausblick-nächster-tagabschlussfolie

Beobachtungen zum Deck

Die Tagesplan-Tabelle (Folie 8) hat in der Rohextraktion eine vertauschte Zeilenreihenfolge (Abschluss-Zeile vor den letzten beiden Zeitzeilen); rekonstruiert nach den genannten Uhrzeiten: 14:00–15:30 Praxis „Bild-Promptgenerator“, danach erst 15:30–16:15 Abschluss.

Die Tagesplan-Tabelle nennt ihre letzte Zeile „Tagesabschluss & Ausblick Tag 12“ — die zugehörige Ausblick-Folie (Folie 37) selbst überschreibt korrekt mit „Ausblick - Tag 13“. Widerspruch wörtlich übernommen.

Der Blocktitel „Bild KI gemeinsam mit Marc erleben“ (12:30–14:00 laut Tabelle) passt inhaltlich nicht zur tatsächlichen Übung an dieser Stelle (Folien 30–32): das ist eine reine Text-Stilanalyse-Übung an Pressemitteilungen der Bundesregierung, keine Bild-KI. Die tatsächliche Bild-Übung („Bild-Promptgenerator“) folgt erst im nächsten Block (14:00–15:30).

Folie 11 („Die Modalitäten-Landkarte“) ist wortgleich mit Folie 48 aus dem Tag-6-Deck (m1-t06) — dieselbe Grafik-Beschreibung wird an zwei verschiedenen Kurstagen identisch wiederverwendet.

Folie 22 enthält eine unverblümte persönliche Einschätzung des Referenten zur Sprachnotiz-Strukturierung: „Claude ist hier u.M.n. erstaunlich schlecht“.

Folie 23 enthält eine rhetorische, im Deck nicht aufgelöste Spekulation: „YouTube-Videos lassen sich am günstigsten mit Google-Tools transkribieren (Warum wohl? ;) )“.

Wiederkehrender Boilerplate-Notiztext (identisch zu den Vortagen) auf Folie 2, 3, 7.

Ausblick

Multimodalität – Wiederholung und Vertiefung

Die „Modalitäten-Landkarte” (Text/Bild/Audio/Daten als Ein- und Ausgabe eines Foundation Models) wird anhand mehrerer Modellanwendungen konkretisiert: Text-to-Image, Image-to-Text, Image-to-Video, Text-to-Video, Image-to-Image, Text-to-Data (JavaScript-Snippet aus Prompt) und Data-to-Text (Produktdaten → Beschreibungstext). Vier konkrete Berufsanwendungsfälle laut Deck: Dashboard-Screenshot analysieren (Zusammenfassung, Handlungsempfehlungen ohne manuelles Ablesen), Tabellen auswerten (Excel/CSV → Code + Erklärung, keine Programmierkenntnisse nötig), Sprachnotiz strukturieren (Diktat unterwegs, fertig aufbereitet am Schreibtisch, mit dem Hinweis, Claude sei hier “erstaunlich schlecht”), Video transkribieren (solide, aber rechenintensiv und teuer; YouTube-Videos am günstigsten mit Google-eigenen Tools).

Expertenvortrag Teil 1 (Marc Elsner): Token-Kosten & Reasoning

Token als Abrechnungseinheit: Text verbraucht am wenigsten, Bilder/PDFs/ Präsentationen werden seitenweise in Bilder umgewandelt und einzeln analysiert (jede Seite kostet extra), Video besteht aus vielen Einzelbildern (Aufwand multipliziert sich), Video mit Audiospur ist am teuersten (separate Audioanalyse). Reasoning-Modelle multiplizieren den Verbrauch zusätzlich durch mehrschrittiges, teils wiederholtes Denken — Faustregel: „Reasoning nur einsetzen, wenn die Aufgabe es wirklich erfordert.” Spar-Tipp: ein PDF/PPT einmalig hochladen und analysieren lassen, das Ergebnis als Markdown-Datei speichern und künftig nur noch diese .md-Datei verwenden — „Markdown ist reiner Text, kein Bild-Rendering, kein Seitenumwandeln, minimaler Token-Verbrauch.” Ausdrückliche Empfehlung: Markdown-Dateien statt der ursprünglichen PDF/PPT ins eigene KI-Kompetenzprofil hochladen.

Praxis: Bild-KI gemeinsam mit Marc erleben

Erster Quick-Win: ein Prompt, der jeden Schreibstil auf sieben Dimensionen analysiert (Tonalität, Satzstruktur, Wortwahl, Perspektive, Zielgruppenansprache, Rhetorik, emotionale Wirkung) und daraus einen Nachahmungs-Leitfaden mit Beispieltext liefert. Geübt wird an Pressemitteilungen der Bundesregierung als „einem der klarsten und konsistentesten (und womöglich trockensten) Kommunikationsstile im deutschen Sprachraum”: Pressemitteilung von bundesregierung.de holen, den Stilanalyse-Prompt in Claude mit dem Text ausführen, die sieben Analysedimensionen auswerten, als Bonus einen neuen Text im analysierten Stil schreiben lassen und gegenprüfen. Der Prompt selbst folgt laut Deck einem 5-Schritte-Aufbau: Rollenanweisung, Anforderungen (7 Dimensionen), 3-Schritt-Prozess (Analyse → Belege → Leitfaden), festes Markdown-Ausgabeformat, Beispiel-Input/Output.

Praxis: Bild-Promptgenerator

Zweiter Quick-Win: die „Prompt Pyramide” verwandelt einfache deutsche Beschreibungen in präzise, professionelle englische Bildprompts entlang acht Dimensionen (Medium, Subject, Activity, Setting, Wardrobe, Lighting, Vibe, Stylistic Details), kompatibel mit Nano Banana (Langdock), Magnific, Flux und Seedream. Aufgabe: eine eigene Bildidee kurz auf Deutsch beschreiben, den Promptbot in Langdock daraus einen englischen Bildprompt generieren lassen, das Ergebnis in Nano Banana testen und mit der eigenen Vorstellung vergleichen; als Bonus eine Variante mit einem eigenen Foto (Produktbild oder Portrait) ausprobieren.

Abschluss: Das nehmen wir mit

Vier Merksätze laut Deck: KI ist multimodal und eröffnet Anwendungsfälle weit über reines Schreiben hinaus; gute Bild-KI-Ergebnisse zu erzielen ist selbst eine Art Skill, KI ersetzt Kunst nicht kampflos; mehr Rechenleistung bedeutet höhere Kosten, aber es gibt Tricks, die langfristig zu senken, als KI-Manager:in macht man sich damit beliebt; wer die gelernten Techniken anwendet, erzielt laut Deck „bessere Bild-Ergebnisse als 80% der KI-Nutzer” — mit dem Aufruf, sich abzuheben, statt „wertlosen AI Slop” zu posten. Ausblick (laut eigener Ausblick-Folie) auf Tag 13: „Moment mal… ist das hier, rechtlich eigentlich alles erlaubt?”