Zum Hauptinhalt springen

9. Kontingente und Governance

9.1 Warum Token-Kontingente?​

Token-Kontingente ermöglichen die kontrollierte, planbare und kostentransparente Nutzung von GovAI in Ihrer Organisation:

  • Kostenkontrolle: Unerwartete Mehrkosten durch übermäßige Nutzung verhindern
  • Fairness: Gleichmäßige Ressourcenverteilung über alle Abteilungen
  • Transparenz: Nutzungsmuster frühzeitig erkennen und optimieren
  • Automatische Sicherung: Bei Überschreitung werden weitere Modellaufrufe automatisch gesperrt
Was ist ein Token?

Ein Token entspricht grob einem Wort oder Wortteil. Ein typischer Chat-Austausch von 500 Wörtern verbraucht etwa 700–1.000 Token (Eingabe + Ausgabe). Thinking Models und Datei-Uploads verbrauchen deutlich mehr Token.

9.2 Kontingent konfigurieren​

Berechtigung: Owner (oder Custom Role mit Kontingent-Konfigurationsrecht)

Konfigurationsparameter:

ParameterOptionenBeschreibung
KontingentwertFrei wählbar (z. B. 1.000.000 Tokens/Monat)Maximale Tokens im Intervall
ErneuerungsintervallEinmalig / Täglich / Wöchentlich / MonatlichWann der Zähler zurückgesetzt wird
Benachrichtigungsschwellez. B. 80 %Vorwarnung vor Kontingenterschöpfung
Sperrschwelle100 %Auslöser für automatische Sperre

Reset-Zeitpunkte:

IntervallReset-Zeitpunkt
Täglich00:00 Uhr Systemzeit
WöchentlichMontag 00:00 Uhr Systemzeit
Monatlich1. Kalendertag 00:00 Uhr Systemzeit
EinmaligKein automatischer Reset; läuft bis zur manuellen Änderung
Historische Daten nach Reset

Nach einem automatischen Reset werden historische Verbräuche nicht gelöscht. Sie bleiben im Dashboard zur Auswertung verfügbar – innerhalb der konfigurierten Aufbewahrungsfristen.

9.3 Was wird gezählt?​

Der Tokenzähler ist organisationsweit und erfasst alle Modellaufrufe:

QuelleGezählt?
Direkte Chat-Anfragen✓
Assistenten-Aufrufe✓
Werkzeug-Aufrufe✓
Community-Prompt-Nutzung✓
RAG-gestützte Anfragen✓ (Embeddings + Modellaufruf)
Data Guard (PII-Erkennung)✓ (separater Datenschutz-Filter-Anteil)
Spracheingabe (Transkription)✓

9.4 Kontingent ändern zur Laufzeit​

Änderungen werden nahe Echtzeit wirksam:

AktionWirkung
ErhöhungRestkontingent wird sofort neu berechnet; Sperre wird ggf. aufgehoben
ReduzierungFalls Ist-Verbrauch > neues Limit: Sperre tritt sofort in Kraft
EntfernenKeine Begrenzung mehr aktiv
Keine negativen Werte

Bei Reduzierung unter den bereits verbrauchten Wert wird das Kontingent nicht negativ. Stattdessen tritt die Auto-Sperre sofort in Kraft.

9.5 Optionale Fortschrittsanzeige im Chat​

Wenn konfiguriert, sehen alle Nutzenden im Chat-Bereich eine Fortschrittsleiste:

  • Zeigt den absoluten Verbrauch im aktuellen Kontingentintervall
  • Farbliche Kennzeichnung wenn das Kontingent erschöpft ist
  • Konfigurierbar durch Administrator (herstellerseitige Einstellung)

9.6 Automatische Sperre (Auto-Lock)​

Wie die Sperre ausgelöst wird​

Wenn der Tokenverbrauch den konfigurierten Schwellwert (100 %) erreicht:

  1. GovAI erkennt die Überschreitung nahe Echtzeit
  2. Alle weiteren Modellaufrufe der Organisation werden gesperrt
  3. Nutzende erhalten eine deutschsprachige Meldung in der Benutzeroberfläche

Wirkung der Sperre​

Die Sperre gilt organisationsweit und umfasst:

GesperrtDetails
Alle ModelleKeine Unterscheidung nach Anbieter oder Modellversion
Alle InteraktionstypenChat, Assistenten, Werkzeuge, Community-Prompts
Alle RAG-AnfragenAuch Wissensdatenbank-Abrufe
Alle RollenMitglied, Maintainer, Owner, Custom Roles

Bereits laufende Anfragen können regulär beendet werden. Neue Anfragen werden serverseitig abgebrochen – bevor externe Modell-Provider kontaktiert werden.

Mandantentrennung

Eine Sperre in Organisation A hat keinen Einfluss auf Organisation B. Kontingente und Sperren wirken strikt mandantenspezifisch.

Sperre aufheben​

MaßnahmeWirkung
Kontingent erhöhenSperre wird sofort aufgehoben
Neuer Kontingentzeitraum beginntZähler wird automatisch zurückgesetzt

9.7 Benachrichtigungen​

Wann wird benachrichtigt?​

EreignisTyp
Benachrichtigungsschwelle erreicht (z. B. 80 %)E-Mail Vorwarnung
Kontingent überschritten (100 % + Sperre)E-Mail Sperre

Empfänger konfigurieren​

In den Organisationseinstellungen können berechtigte Rollen als Empfänger für E-Mail-Benachrichtigungen ausgewählt werden:

  • Neben Standardrollen auch Custom Roles wählbar
  • Konfiguration ist mandantenspezifisch
  • Empfängerliste wird dynamisch aus den Nutzenden der ausgewählten Rollen gebildet

Inhalt der Benachrichtigung​

E-Mail-Benachrichtigungen enthalten mindestens:

  • Betroffene Organisation (Name)
  • Grund der Benachrichtigung (z. B. „Token-Kontingent ist zu 80 % erschöpft")
  • Zeitstempel

Protokollierung​

Alle Benachrichtigungen werden im Audit-Log protokolliert mit: Organisation, Art (Vorwarnung/Sperre), Zeitstempel und Empfängerkreis.

9.8 Dashboard und Auswertung​

Das Dashboard zeigt den vollständigen Überblick über Nutzung und Kontingente:

Zugriff: Einstellungen → Nutzungsstatistik

Verfügbare Kennzahlen:

BereichDetails
TokenverbrauchAggregiert nach Zeitraum (Tag/Woche/Monat/benutzerdefiniert)
AufschlüsselungNach Modell, Assistenten, Werkzeug, Interaktionstyp
Kontingent-StatusKonfiguriertes Kontingent, verbrauchte Tokens, Restkontingent
ZeitreiheHistorischer Verbrauch für Trendanalyse und Planung

Filter:

  • Zeitraum
  • Modell/Modellkategorie
  • Assistent/Werkzeug
  • Interaktionstyp

Diagrammansicht: Konfigurierbare Balkendiagramme nach Modell, Assistent oder Werkzeug über einen frei wählbaren Zeitraum.

Zugriffssteuerung Dashboard

Das Dashboard ist primär für Owner bestimmt. Mitglieder und Maintainer haben standardmäßig keinen Zugriff, es sei denn, eine Custom Role wurde entsprechend konfiguriert.

9.9 Planung und Best Practices​

Empfehlungen für die Kontingentkonfiguration:

  1. Pilotphase: Starten Sie ohne hartes Kontingent, um Baseline-Verbrauchswerte zu messen
  2. Benachrichtigungsschwelle: 70–80 % ist bewährt – genug Vorlaufzeit für Anpassungen
  3. Monatliches Intervall: Für die meisten Behörden sinnvoll (entspricht Budget-Zyklen)
  4. Regelmäßige Auswertung: Nutzen Sie das Dashboard vierteljährlich für Kapazitätsplanung
  5. Reserve einplanen: Kalkulieren Sie einen 20 %-Puffer für Lastspitzen (z. B. Jahresabschlüsse, Projektphasen)