9. Kontingente und Governance
9.1 Warum Token-Kontingente?
Token-Kontingente ermöglichen die kontrollierte, planbare und kostentransparente Nutzung von GovAI in Ihrer Organisation:
- Kostenkontrolle: Unerwartete Mehrkosten durch übermäßige Nutzung verhindern
- Fairness: Gleichmäßige Ressourcenverteilung über alle Abteilungen
- Transparenz: Nutzungsmuster frühzeitig erkennen und optimieren
- Automatische Sicherung: Bei Überschreitung werden weitere Modellaufrufe automatisch gesperrt
Ein Token entspricht grob einem Wort oder Wortteil. Ein typischer Chat-Austausch von 500 Wörtern verbraucht etwa 700–1.000 Token (Eingabe + Ausgabe). Thinking Models und Datei-Uploads verbrauchen deutlich mehr Token.
9.2 Kontingent konfigurieren
Berechtigung: Owner (oder Custom Role mit Kontingent-Konfigurationsrecht)
Konfigurationsparameter:
| Parameter | Optionen | Beschreibung |
|---|---|---|
| Kontingentwert | Frei wählbar (z. B. 1.000.000 Tokens/Monat) | Maximale Tokens im Intervall |
| Erneuerungsintervall | Einmalig / Täglich / Wöchentlich / Monatlich | Wann der Zähler zurückgesetzt wird |
| Benachrichtigungsschwelle | z. B. 80 % | Vorwarnung vor Kontingenterschöpfung |
| Sperrschwelle | 100 % | Auslöser für automatische Sperre |
Reset-Zeitpunkte:
| Intervall | Reset-Zeitpunkt |
|---|---|
| Täglich | 00:00 Uhr Systemzeit |
| Wöchentlich | Montag 00:00 Uhr Systemzeit |
| Monatlich | 1. Kalendertag 00:00 Uhr Systemzeit |
| Einmalig | Kein automatischer Reset; läuft bis zur manuellen Änderung |
Nach einem automatischen Reset werden historische Verbräuche nicht gelöscht. Sie bleiben im Dashboard zur Auswertung verfügbar – innerhalb der konfigurierten Aufbewahrungsfristen.
9.3 Was wird gezählt?
Der Tokenzähler ist organisationsweit und erfasst alle Modellaufrufe:
| Quelle | Gezählt? |
|---|---|
| Direkte Chat-Anfragen | ✓ |
| Assistenten-Aufrufe | ✓ |
| Werkzeug-Aufrufe | ✓ |
| Community-Prompt-Nutzung | ✓ |
| RAG-gestützte Anfragen | ✓ (Embeddings + Modellaufruf) |
| Data Guard (PII-Erkennung) | ✓ (separater Datenschutz-Filter-Anteil) |
| Spracheingabe (Transkription) | ✓ |
9.4 Kontingent ändern zur Laufzeit
Änderungen werden nahe Echtzeit wirksam:
| Aktion | Wirkung |
|---|---|
| Erhöhung | Restkontingent wird sofort neu berechnet; Sperre wird ggf. aufgehoben |
| Reduzierung | Falls Ist-Verbrauch > neues Limit: Sperre tritt sofort in Kraft |
| Entfernen | Keine Begrenzung mehr aktiv |
Bei Reduzierung unter den bereits verbrauchten Wert wird das Kontingent nicht negativ. Stattdessen tritt die Auto-Sperre sofort in Kraft.
9.5 Optionale Fortschrittsanzeige im Chat
Wenn konfiguriert, sehen alle Nutzenden im Chat-Bereich eine Fortschrittsleiste:
- Zeigt den absoluten Verbrauch im aktuellen Kontingentintervall
- Farbliche Kennzeichnung wenn das Kontingent erschöpft ist
- Konfigurierbar durch Administrator (herstellerseitige Einstellung)
9.6 Automatische Sperre (Auto-Lock)
Wie die Sperre ausgelöst wird
Wenn der Tokenverbrauch den konfigurierten Schwellwert (100 %) erreicht:
- GovAI erkennt die Überschreitung nahe Echtzeit
- Alle weiteren Modellaufrufe der Organisation werden gesperrt
- Nutzende erhalten eine deutschsprachige Meldung in der Benutzeroberfläche
Wirkung der Sperre
Die Sperre gilt organisationsweit und umfasst:
| Gesperrt | Details |
|---|---|
| Alle Modelle | Keine Unterscheidung nach Anbieter oder Modellversion |
| Alle Interaktionstypen | Chat, Assistenten, Werkzeuge, Community-Prompts |
| Alle RAG-Anfragen | Auch Wissensdatenbank-Abrufe |
| Alle Rollen | Mitglied, Maintainer, Owner, Custom Roles |
Bereits laufende Anfragen können regulär beendet werden. Neue Anfragen werden serverseitig abgebrochen – bevor externe Modell-Provider kontaktiert werden.
Eine Sperre in Organisation A hat keinen Einfluss auf Organisation B. Kontingente und Sperren wirken strikt mandantenspezifisch.
Sperre aufheben
| Maßnahme | Wirkung |
|---|---|
| Kontingent erhöhen | Sperre wird sofort aufgehoben |
| Neuer Kontingentzeitraum beginnt | Zähler wird automatisch zurückgesetzt |
9.7 Benachrichtigungen
Wann wird benachrichtigt?
| Ereignis | Typ |
|---|---|
| Benachrichtigungsschwelle erreicht (z. B. 80 %) | E-Mail Vorwarnung |
| Kontingent überschritten (100 % + Sperre) | E-Mail Sperre |
Empfänger konfigurieren
In den Organisationseinstellungen können berechtigte Rollen als Empfänger für E-Mail-Benachrichtigungen ausgewählt werden:
- Neben Standardrollen auch Custom Roles wählbar
- Konfiguration ist mandantenspezifisch
- Empfängerliste wird dynamisch aus den Nutzenden der ausgewählten Rollen gebildet
Inhalt der Benachrichtigung
E-Mail-Benachrichtigungen enthalten mindestens:
- Betroffene Organisation (Name)
- Grund der Benachrichtigung (z. B. „Token-Kontingent ist zu 80 % erschöpft")
- Zeitstempel
Protokollierung
Alle Benachrichtigungen werden im Audit-Log protokolliert mit: Organisation, Art (Vorwarnung/Sperre), Zeitstempel und Empfängerkreis.
9.8 Dashboard und Auswertung
Das Dashboard zeigt den vollständigen Überblick über Nutzung und Kontingente:
Zugriff: Einstellungen → Nutzungsstatistik
Verfügbare Kennzahlen:
| Bereich | Details |
|---|---|
| Tokenverbrauch | Aggregiert nach Zeitraum (Tag/Woche/Monat/benutzerdefiniert) |
| Aufschlüsselung | Nach Modell, Assistenten, Werkzeug, Interaktionstyp |
| Kontingent-Status | Konfiguriertes Kontingent, verbrauchte Tokens, Restkontingent |
| Zeitreihe | Historischer Verbrauch für Trendanalyse und Planung |
Filter:
- Zeitraum
- Modell/Modellkategorie
- Assistent/Werkzeug
- Interaktionstyp
Diagrammansicht: Konfigurierbare Balkendiagramme nach Modell, Assistent oder Werkzeug über einen frei wählbaren Zeitraum.
Das Dashboard ist primär für Owner bestimmt. Mitglieder und Maintainer haben standardmäßig keinen Zugriff, es sei denn, eine Custom Role wurde entsprechend konfiguriert.
9.9 Planung und Best Practices
Empfehlungen für die Kontingentkonfiguration:
- Pilotphase: Starten Sie ohne hartes Kontingent, um Baseline-Verbrauchswerte zu messen
- Benachrichtigungsschwelle: 70–80 % ist bewährt – genug Vorlaufzeit für Anpassungen
- Monatliches Intervall: Für die meisten Behörden sinnvoll (entspricht Budget-Zyklen)
- Regelmäßige Auswertung: Nutzen Sie das Dashboard vierteljährlich für Kapazitätsplanung
- Reserve einplanen: Kalkulieren Sie einen 20 %-Puffer für Lastspitzen (z. B. Jahresabschlüsse, Projektphasen)