So entsteht aus einem Gespräch ein KI-Protokoll

Inhalt
- So entsteht ein automatisches Protokoll
- Die Stufen im Überblick
- Warum die Schritte zusammenhängen
- Lokal oder in der Cloud
- Wie kommt das Audio in die Verarbeitung?
- System-Audio statt Bot
- Warum die Tonqualität zählt
- Wie genau ist automatische Transkription auf Deutsch?
- Deutsch im Vergleich
- Fachwörter und Dialekt
- Erkennt die KI, wer gesprochen hat?
- Wie Zuordnung gemessen wird
- Wann es zuverlässig klappt und wann nicht
- Von Sprecher 1 zum Namen
- Wie wird aus dem Transkript ein Protokoll?
- Zusammenfassung und Aufgaben
- Wie die Qualität abgesichert wird
- Was ein KI-Protokoll außerdem kann
- Alles wiederfinden, ohne erneut zuzuhören
- Aufgaben, die direkt weiterwandern
- Was sonst im Protokoll landet und wie es weitergeht
- Was macht die Verarbeitung DSGVO-konform?
- Wer die Daten verarbeitet
- Einwilligung der Teilnehmenden
- Häufig gestellte Fragen
- Quellen
Das Meeting endet um 15 Uhr. Zwei Minuten später liegt ein Protokoll im Postfach, mit Zusammenfassung, drei Entscheidungen und fünf Aufgaben samt Zuständigkeit. Mitgeschrieben hat niemand. Für viele wirkt das wie eine Blackbox, und Blackboxen macht man ungern zur Grundlage einer Dokumentation. Dabei ist der Vorgang gut nachvollziehbar. Mehrere Schritte laufen nacheinander ab, jeder mit einer eigenen Aufgabe, und wer sie kennt, weiß, was die Technik zuverlässig erledigt.
So entsteht ein automatisches Protokoll
Von den deutschen Unternehmen, die KI einsetzen, nutzten 2024 bereits 47 Prozent Technologien zur Spracherkennung (destatis.de). Damit ist die Anwendung verbreiteter als automatische Textgenerierung. Das Thema ist auch in den Chefetagen angekommen, denn 69 Prozent von 653 befragten Entscheiderinnen und Entscheidern aus 18 Branchen haben bereits eine KI-Strategie aufgesetzt und 72 Prozent planen höhere Investitionen (kpmg.com). Der Kreis wächst schnell, denn im Mai 2026 setzten 54,5 Prozent der deutschen Unternehmen KI ein, ein Jahr zuvor 40,9 Prozent (ifo.de). Trotzdem beschreibt kaum eine Produktseite, was nach dem Klick auf „Aufnahme beenden" passiert.
Die Stufen im Überblick
Zuerst wird das Gespräch als Audiodatei erfasst. Dann wandelt die automatische Transkription die Tonspur in Text um. Das Ergebnis heißt Transkript und ist eine wörtliche Mitschrift von allem Gesagten, ohne Auswahl oder Gliederung. Danach ordnet ein zweiter Schritt die Textabschnitte den einzelnen Sprechenden zu. Erst dann formt ein Sprachmodell daraus eine Zusammenfassung, eine Beschlussliste und eine Aufgabenliste. Ein Sprachmodell ist dieselbe Art von Technik wie hinter Chatbots, hier bekommt sie den Transkripttext und den Auftrag, ihn zu ordnen. Am Ende steht die Freigabe durch einen Menschen.
Warum die Schritte zusammenhängen
Jeder Schritt arbeitet mit dem Ergebnis des vorherigen. Das Sprachmodell am Ende hat das Gespräch nie gehört, es liest nur den Text der automatischen Transkription. Deshalb wirkt sich eine gute Aufnahme bis ins fertige Dokument aus und bringt mehr als jede spätere Korrektur.
Lokal oder in der Cloud
Der zweite Unterschied liegt nicht in den Stufen, sondern im Ort. Bei einer Cloud-Lösung geht die Tonspur über das Internet an die Rechner des Anbieters und kommt als Ergebnis zurück, Sie brauchen keine starke Hardware, geben die Aufnahme aber aus der Hand. Bei einer lokalen Lösung laufen alle Schritte auf Ihrem Rechner, das Gespräch verlässt das Gerät nicht, und die Rechenarbeit schaffen moderne Bürorechner inzwischen selbst. Funktional kommt Ähnliches heraus, für eine DSGVO-konforme Transkription ist der Unterschied aber entscheidend, und welcher der drei Ansätze für KI in Meetings dahintersteht, bestimmt ihn mit. Diese Ortsfrage kommt am Ende zurück. Zuerst zählt, was überhaupt in die Kette hineingeht.
| Schritt | Worauf es ankommt |
|---|---|
| 1. Aufnahme | Störgeräusche und Echo |
| 2. Mitschrift | rund ein falsches Wort auf zwanzig |
| 3. Wer hat gesprochen | stark abhängig von der Mikrofonsituation |
| 4. Zusammenfassung | lässt eher Punkte weg, als welche zu erfinden |
| 5. Freigabe durch einen Menschen | letzte Prüfung vor dem Versand |
Quelle: Eigene Systematisierung nach den in diesem Artikel zitierten Benchmarks.
Wie kommt das Audio in die Verarbeitung?
Für die meisten Termine ist dieser Schritt unkritisch. In Europa finden 25 Prozent der Meetings hybrid und 21 Prozent rein online statt (digitaleneuordnung.de), und dort spricht ohnehin jede Person in ihr eigenes Gerät, die beste Ausgangslage ganz ohne Zusatzausstattung. Aufwendiger wird es nur, wenn mehrere Menschen in einem Raum sitzen und sich ein Mikrofon teilen.
System-Audio statt Bot
Es gibt zwei Wege. Entweder greift die Software den Audiostrom des Betriebssystems ab, also alles, was über Lautsprecher und Mikrofon läuft, oder ein zusätzlicher Teilnehmer im Videocall zeichnet mit. Der erste Weg funktioniert unabhängig von der Konferenzsoftware und deckt auch Telefonate und Präsenztermine ab. Jexity Meet nutzt diesen Weg und rechnet dabei das Echo heraus, das entsteht, wenn das Mikrofon die Stimmen aus dem eigenen Lautsprecher noch einmal mit aufnimmt. Bei einer fertigen Aufnahme, etwa aus einem Diktiergerät, entfällt der Schritt und es geht direkt mit der Mitschrift weiter.
Warum die Tonqualität zählt
Spracherkennung arbeitet am besten, wenn jede Stimme sauber und einzeln ankommt, bei Online- und Hybridterminen also automatisch. Sitzt dagegen eine größere Runde um ein Gerät in der Tischmitte, kommen mehrere Stimmen aus unterschiedlichen Entfernungen an, dazu Hall und Nebengeräusche, wogegen ein zweites Mikrofon oft schon genügt. Dazu kommt ein selten erwähnter Schritt. Bevor ein Wort erkannt wird, entscheidet das System, welche Abschnitte der Tonspur Sprache enthalten und welche nur Rauschen oder Stille. Was bei dieser Segmentierung falsch abgegrenzt wird, geht als Fehler in die nächsten Stufen. Welche Aufzeichnungsmethode Sie wählen, ist damit eine Entscheidung über die Protokollqualität. Wie gut die nächste Stufe damit umgeht, lässt sich erstaunlich genau beziffern.

Wie genau ist automatische Transkription auf Deutsch?
Besser, als die meisten Skeptiker erwarten. Deutsch gehört zu den gut vermessenen Sprachen, und die Werte sind öffentlich nachprüfbar, statt aus Anbieterversprechen zu stammen.
Deutsch im Vergleich
Gemessen wird die Qualität an der Wortfehlerrate, die ausgelassene, hinzugefügte und falsch erkannte Wörter zusammenzählt und durch die Gesamtzahl der gesprochenen Wörter teilt. Fünf Prozent heißt also, dass in einem Satz mit zwanzig Wörtern statistisch eines nicht stimmt. Ein öffentlicher Vergleich hat über 60 Spracherkennungssysteme auf denselben Testdaten gemessen. Die fünf besten liegen auf Deutsch zwischen 4,50 und 5,36 Prozent Wortfehlerrate (arxiv.org), zwischen dem besten und dem fünftbesten liegt also weniger als ein Prozentpunkt. Welches System in Ihrer Software steckt, entscheidet damit weniger über das Ergebnis als die Frage, wie sauber Sie aufnehmen.
Fachwörter und Dialekt
Drei Dinge bleiben knifflig. Eigennamen und interne Kürzel, die in keinem Wörterbuch stehen, auf dem die Systeme trainiert wurden. Starker Dialekt, denn gemessen wird mit Standarddeutsch. Und der Sprachwechsel mitten im Satz, wo es darauf ankommt, ob das System mehrere Sprachen beherrscht oder auf Deutsch festgelegt ist. So verlässlich die Worterkennung inzwischen ist, so sehr hängt der nächste Schritt von der Situation ab.
Erkennt die KI, wer gesprochen hat?
Der Fachbegriff dafür lautet Diarisierung. Gemeint ist die Frage, welcher Abschnitt des Textes von welcher Person stammt. Von allen Schritten hängt dieser am stärksten von der Aufnahmesituation ab, deshalb lohnt es sich zu wissen, wann er zuverlässig klappt und wann er Unterstützung braucht.
Wie Zuordnung gemessen wird
Auch dafür gibt es eine Messgröße aus drei Fehlerarten, nämlich übersehene Sprache, fälschlich als Sprache gewertete Geräusche und Abschnitte, die der falschen Person zugeschlagen werden (ldc.upenn.edu). Anders als bei der Wortfehlerrate liegen die Ergebnisse weit auseinander, weil sie stark von der Aufnahme abhängen.
Wann es zuverlässig klappt und wann nicht
Sitzt jede Person an ihrem eigenen Gerät, ist die Zuordnung im Normalfall sauber. Schwieriger wird es, wenn eine größere Runde in einem Raum sitzt und ein einzelnes Mikrofon alles aufnimmt. Genau diese Situation wurde in einem Forschungswettbewerb als Extremfall geprüft, und dort ordnete selbst das beste System über 45 Prozent der Sprechzeit falsch zu (ldc.upenn.edu). Ein Vergleich von fünf Systemen auf dreizehn Aufnahmesammlungen bestätigt, wie stark das Ergebnis von der Situation abhängt (isca-archive.org). Für die Praxis heißt das, Online-Termine sind unproblematisch, ein voller Besprechungsraum verdient ein zweites Mikrofon.
Von Sprecher 1 zum Namen
Die Zuordnung liefert zunächst nur anonyme Kennungen. Aus „Sprecher 2" wird „Frau Berger", sobald jemand die Namen vergibt. Manche Systeme schlagen sie aus dem Gesprächsverlauf vor, etwa wenn sich Teilnehmende gegenseitig ansprechen. Die Bestätigung bleibt beim Menschen, weil eine falsch benannte Zusage schlimmer ist als eine unbenannte.
Wie wird aus dem Transkript ein Protokoll?
Die wörtliche Mitschrift liest niemand freiwillig, eine Stunde Meeting ergibt schnell zehn Seiten. Erst der vierte Schritt macht daraus ein nutzbares Dokument, und daran entscheidet sich, wie brauchbar das KI-Protokoll ausfällt.
Zusammenfassung und Aufgaben
Ein Sprachmodell bekommt das Transkript und eine Anweisung, welche Struktur herauskommen soll. Üblich sind drei Blöcke, eine Zusammenfassung des Verlaufs, eine Liste der Beschlüsse und eine Liste der Aufgaben mit Verantwortlichen und Terminen. Ein Modell, dem nur „fasse zusammen" gesagt wird, liefert Fließtext statt einer ablegbaren Struktur. Gute Systeme geben die Gliederung deshalb fest vor.
Wie die Qualität abgesichert wird
Dass eine frei formulierte Zusammenfassung nicht immer alles trifft, ist bekannt, und die Forschung arbeitet daran. Eine Arbeit an 200 automatisch erzeugten Meeting-Protokollen hat neun Fehlerarten sortiert, darunter weggelassene Punkte und Inhalte, die nicht hineingehören. Vor allem zeigt sie einen Weg, das automatisch zu beheben. Ein zweites Modell prüft die Zusammenfassung gegen das Transkript, benennt Abweichungen und lässt sie in einem zweiten Durchgang korrigieren, was Relevanz, Vollständigkeit und Klarheit messbar verbessert (aclanthology.org). Diese Prüfschleife steckt inzwischen in vielen Systemen, ohne dass der Nutzer davon etwas merkt.
Was ein KI-Protokoll außerdem kann
Das fertige Dokument ist nur ein Teil dessen, was dabei entsteht. Weil Audio, Mitschrift und Zeitmarken erhalten bleiben, kommen Funktionen dazu, die eine handschriftliche Notiz nie bieten konnte. Das zahlt sich aus, denn ohne Wiederholung gehen bis zu 70 Prozent neuer Informationen binnen 24 Stunden verloren (pmc.ncbi.nlm.nih.gov).
Alles wiederfinden, ohne erneut zuzuhören
Jedes Wort der Mitschrift trägt eine Zeitmarke. Wer wissen will, wie ein Beschluss zustande kam, sucht den Begriff und springt an die passende Stelle der Aufnahme. Über mehrere Termine entsteht ein durchsuchbares Gedächtnis des Teams. Manche Systeme lassen sich sogar direkt befragen, etwa mit „Was haben wir zum Budget entschieden?", wahlweise zu einem Termin oder über die gesamte Sammlung. Dass das keine Spielerei ist, zeigt die Forschung, die solche Rückfragen zu vergangenen Besprechungen inzwischen als eigene Aufgabe neben der Protokollerstellung systematisch prüft (arxiv.org).
Aufgaben, die direkt weiterwandern
Weil die Aufgabenliste strukturiert vorliegt und nicht als Fließtext, wandern Verantwortliche und Termine aus getrennten Feldern direkt in ein Aufgabentool. Der Bruch zwischen Protokoll und Umsetzung, der beim manuellen Weg entsteht, fällt weg.
Was sonst im Protokoll landet und wie es weitergeht
Was auf dem geteilten Bildschirm zu sehen war, lässt sich als Bild übernehmen, sodass die besprochene Folie an der richtigen Stelle steht und wer später liest die Zahlen selbst sieht. Das Protokoll lässt sich als PDF oder Textdatei in der Dokumentenablage oder im Firmenwiki ablegen. Deutsch und Englisch werden auch gemischt im selben Termin verarbeitet. Systeme, die lokal arbeiten, funktionieren zudem unabhängig von der Konferenzsoftware, bei Videocalls ebenso wie am Telefon oder im Besprechungsraum, und brauchen keine Internetverbindung. Jexity Meet vereint diese Bausteine standardmäßig lokal in einer Anwendung, andere Anbieter setzen eigene Schwerpunkte.

Unterm Strich verschiebt sich die Arbeit vom Abtippen zum Lesen. Eine Modellrechnung aus der Praxis kommt von anderthalb Stunden Nachbereitung auf rund zehn Minuten, bei fünfzig Terminen im Jahr also rund 67 gesparte Stunden und bei 60 Euro Stundensatz etwa 4.000 Euro pro Person (himmelblau-digital.de). Bleibt die Frage, die am Anfang offengeblieben ist, nämlich wo diese ganze Kette überhaupt rechnen darf.
Was macht die Verarbeitung DSGVO-konform?
Die Rechtsfragen lassen sich klären, sie sind aber der Punkt, an dem die meisten zögern. Von den Unternehmen ohne KI haben 18 Prozent den Einsatz erwogen, und in dieser Gruppe nennen 58 Prozent unklare Rechtsfolgen und 53 Prozent Datenschutzbedenken (destatis.de).
Wer die Daten verarbeitet
Verlässt die Tonspur das Unternehmen, verarbeitet ein Dienstleister Ihre Daten in Ihrem Auftrag. Die DSGVO nennt das Auftragsverarbeitung und verlangt dafür einen eigenen Vertrag, eine Prüfung des Serverstandorts und eine Löschfrist. Bleibt die Verarbeitung auf dem Gerät, entfällt dieser Block, weil kein Dritter beteiligt ist, und eine DSGVO-konforme Transkription wird erheblich einfacher. Jexity Meet ist für diesen Fall gebaut und führt die automatische Transkription immer und die Strukturierung in der Standardeinstellung ohne Übertragung an einen Dienst aus. Wo die fertigen Protokolle und Aufnahmen anschließend abgelegt werden, entscheidet weiterhin Ihr Unternehmen und nicht das Werkzeug.
Einwilligung der Teilnehmenden
Der Verarbeitungsort löst nur die Hälfte. Eine Aufnahme des nicht öffentlich gesprochenen Wortes ohne Einwilligung ist nach § 201 StGB strafbar, egal wo die Datei danach verarbeitet wird (gesetze-im-internet.de). Eine DSGVO-konforme Transkription setzt deshalb zwei Dinge voraus, eine tragfähige Rechtsgrundlage und die informierte Zustimmung aller Beteiligten zur Aufnahme. Die rechtlichen Anforderungen an die Aufzeichnung gelten unverändert.
Häufig gestellte Fragen
Wie genau ist automatische Transkription auf Deutsch?
Auf sorgfältig ausgewählten Testaufnahmen erreichen führende Systeme zwischen 4,50 und 5,36 Prozent falsch erkannte Wörter (arxiv.org), also rund ein falsches Wort auf zwanzig. In echten Meetings liegt der Wert höher. Für Zusammenfassungen reicht das, für wörtliche Zitate nicht.
Muss ich ein KI-Protokoll noch nachbearbeiten?
In der Regel genügt ein kurzer Blick auf die Aufgabenliste vor dem Versand. Moderne Systeme lassen die Zusammenfassung zusätzlich von einem zweiten Modell gegen die Mitschrift prüfen und automatisch nachbessern (aclanthology.org). Rechnen Sie mit rund zehn Minuten pro Meeting.
Warum stimmt die Sprecherzuordnung manchmal nicht?
Weil die Zuordnung stark von der Aufnahmesituation abhängt. Bei Aufnahmen über ein Mikrofon im Raum statt über einzelne Headsets ordnete in einem Forschungswettbewerb selbst das beste System über 45 Prozent der Sprechzeit falsch zu (ldc.upenn.edu). Getrennte Mikrofone helfen mehr als jede Softwareeinstellung.
Was bringt ein KI-Protokoll gegenüber einer Mitschrift von Hand?
Vor allem Vollständigkeit, Auffindbarkeit und Zeit. Die Mitschrift enthält jedes Wort mit Zeitmarke, Aufgaben stehen mit Verantwortlichen und Terminen da, und Sie können den Termin nachträglich durchsuchen oder ihm Fragen stellen. Eine Modellrechnung kommt von anderthalb Stunden Nachbereitung auf rund zehn Minuten (himmelblau-digital.de).
Welche Meetings eignen sich nicht für automatische Protokolle?
Termine, bei denen der Wortlaut rechtlich zählt, etwa Kündigungsgespräche, weil ein automatisches Transkript ohne Gegenhören nicht zitierfähig ist. Ebenso Gespräche, in denen jemand der Aufnahme nicht zustimmt, denn ohne Einwilligung ist sie nach § 201 StGB strafbar (gesetze-im-internet.de).
Quellen(12)
- destatis.deStatistisches Bundesamt: Jedes fünfte Unternehmen nutzt künstliche Intelligenz (2024)
- arxiv.orgarXiv: Open ASR Leaderboard, Wortfehlerraten im Vergleich (2025)
- pmc.ncbi.nlm.nih.govPMC: Studie zum Vergessen neuer Informationen ohne Wiederholung
- himmelblau-digital.deHimmelblau Digital: Meeting-Protokolle mit KI, von anderthalb Stunden auf zehn Minuten
- kpmg.comKPMG: Generative KI in der deutschen Wirtschaft 2025 (2025)
- ifo.deifo Institut: Mehr als die Hälfte der Unternehmen in Deutschland nutzt Künstliche Intelligenz (2026)
- digitaleneuordnung.deDigitale Neuordnung: Meeting-Zahlen und Statistiken 2025
- ldc.upenn.eduLDC: The Third DIHARD Diarization Challenge (2021)
- isca-archive.orgISCA Archive: Vergleich von Sprecherdiarisierungs-Systemen, Interspeech 2025
- aclanthology.orgACL Anthology: What's Wrong? Refining Meeting Summaries with LLM Feedback (2025)
- arxiv.orgarXiv: Findings of the Third Automatic Minuting (AutoMin) Challenge (2025)
- gesetze-im-internet.deGesetze im Internet: § 201 StGB, Verletzung der Vertraulichkeit des Wortes
Dieser Artikel wurde mit KI-Unterstützung erstellt und redaktionell geprüft. Die Bilder sind KI-generiert.
Weiterlesen

Den richtigen KI Meeting Protokoll Assistenten finden
Drei von vier Berufstätigen nutzen bereits einen KI-Notiztaker, doch die Einführung scheitert häufig an Datenschutzbedenken, fehlender Akzeptanz oder falschen Erwartungen. Der Vergleich zwischen Bot, Plattform-KI und eigenständigem Tool deckt auf, worauf es bei Datenschutz, Kosten und Akzeptanz wirklich ankommt.
14 Min. Lesezeit
Meeting-Protokoll-Kosten: So viel kostet ein Protokoll wirklich
Protokolle schreiben gehört zum Arbeitsalltag, aber kaum jemand rechnet die Kosten durch. Dieser Artikel zeigt, was ein einzelnes Protokoll kostet, welche versteckten Kosten Unternehmen übersehen und ab wann sich automatische Protokollerstellung lohnt.
15 Min. Lesezeit
KI Bot, Plattform KI und eigenständige Tools im Vergleich
Hinter dem Begriff KI für Meetings stecken drei grundverschiedene Ansätze. Ein Bot im Videocall, die eingebaute KI von Microsoft Teams, Zoom oder Google Meet und ein eigenständiges Tool wie Jexity Meet auf dem eigenen Rechner unterscheiden sich bei Datenhaltung, Akzeptanz und Plattformbindung stärker, als die meisten Vergleichsartikel vermuten lassen.
14 Min. LesezeitTesten Sie es im nächsten Meeting
Nehmen Sie ein Meeting auf oder importieren Sie eines und sehen Sie sich das Protokoll an. Ohne Konto und ohne Kreditkarte.