An acht Stellen reden statt tippen.
Dieses Modul hat keinen eigenen Bildschirm. Es ist das Mikrofon in acht Erfassungsstrecken — und ein Knopf, der auf jedem Bildschirm mitgeht, für den Fall, dass gerade etwas schiefläuft.
Das ist das Diktat in der App — nicht der Chat. Die Frage „was hat Halle 3 bisher gekostet" beantwortet BidiGPT, ein eigenes Produkt mit eigener Seite. Hier geht es um das Gegenteil: nicht fragen, sondern erfassen.
Vier Stationen vom Satz zum Eintrag
Zwischen „ich sag's mal eben" und einem sauberen Eintrag liegen vier Schritte — und der letzte gehört dir.
Du drückst und redest
In sieben Modulen sitzt der Knopf dort, wo du gerade arbeitest. Für die Störung liegt er zusätzlich fest auf dem Bildschirm — unten rechts, auf jeder Seite der App. Der Grund ist banal: eine Störung siehst du selten dort, wo du sie melden würdest.
Der Satz nimmt den Weg, der gerade trägt
Während du redest, laufen zwei Aufnahmen gleichzeitig: die Spracherkennung des Browsers, die dir live mitschreibt, und ein stiller Mitschnitt als Rückhalt. Kommt die erste nicht durch, geht der Mitschnitt an den Server. Wie das genau läuft, steht unten.
Aus dem Text werden Felder
Erst danach kommt die eigentliche KI. Sie räumt den gesprochenen Text auf — die Anweisung an sie beginnt mit „Du bist ein erfahrener Bauleiter" — und füllt daraus die Felder des jeweiligen Vorgangs. Bei einer Störung sind das zwei Durchgänge: erst die Art erkennen, dann die Felder, die zu dieser Art gehören. Das Modell dahinter kommt von Anthropic. Hast du einen eigenen Zugang hinterlegt, fährt die Strecke über deinen — hast du keinen, fährt sie über den Zugang von Bidi.
Du bestätigst — nicht die KI
Was zurückkommt, ist ein Vorschlag, kein Eintrag. Die KI-Strecke speichert selbst nichts; du siehst die gefüllte Maske, änderst was nicht stimmt, und erst dein Speichern legt den Vorgang an. Das ist keine Vorsicht, das ist die Bauleitung: unterschreiben tut der Mensch.
Wo das Diktat sitzt, ist kein Zufall. Es hängt an den Strecken, an denen unter Zeitdruck erfasst wird — Tagesbericht, Aufmaß, Stunden, Regie, Störung. Wo in Ruhe im Büro gearbeitet wird, gibt es keins, und das ist so gewollt: ein Mikrofon, das überall klebt, benutzt am Ende niemand.
Die Umleitung
Auf der Baustelle ist die Verbindung das Problem, nicht die Erkennung. Deshalb hat jeder diktierte Satz zwei Wege zum selben Ziel — und du merkst nicht, welchen er genommen hat.
- Spracherkennung im Browser
- Schreibt live mit, während du redest
- Braucht die Server des Browser-Herstellers — auf der Baustelle oft nicht erreichbar
- Kommt sie durch, zählt ihr TextWeb Speech API
- Stiller Mitschnitt läuft die ganze Zeit mit
- Bei einem Netzfehler geht er an den Server
- Dort erkennt ihn Google Speech-to-Textlatest_long · de-DE · mit Satzzeichen
- Ersatzweise OpenAI Whisperwhisper-1 · nur ohne Google-Zugang
Der Mitschnitt wird nicht aufbewahrt. Er entsteht nur für den Fall, dass die Hauptfahrbahn ausfällt, und ist nach der Erkennung weg — es gibt in Bidi kein Archiv von Tonaufnahmen deiner Leute.
Warum es diesen Umweg überhaupt gibt
Die Spracherkennung im Browser schickt das Gesprochene an die Server ihres Herstellers. Auf Baustellen ist genau dieser Weg oft dicht — Gastzugang, Firmen-Filter, VPN, schlechtes Netz. Ohne Rückfall stünde der Polier dann mit einem Knopf da, der nichts tut. Der Umweg ist der Grund, warum das Diktat auf der Baustelle benutzbar ist — und nicht nur im Büro.
Acht Stellen, nicht fünf
Unsere bisherige Modulübersicht nennt fünf. Alle fünf stimmen — es sind nur nicht alle.
- Bautagebuch — der Tagesbericht
- Aufmaß — Zeilen mit Menge und Position
- Zeiterfassung — mehrere Buchungen aus einem Diktat
- Störungen — und zwar von jedem Bildschirm aus
- Tätigkeitsbericht — der Bericht beim Kunden
- Regiebericht — Stundenlohnarbeiten vor OrtRegieberichtVoiceModal
- Begehung — die Feststellung beim RundgangFeststellungVoiceModal
- Bau-Angebot — der Langtext einer LV-PositionAngebotPositionDetailModal
Und eine Genauigkeit, die auf der Karte fehlt
Die Störung ist die einzige der acht, die keinen festen Ort hat. Für die anderen sieben öffnest du erst den Vorgang und drückst dann. Die Störung meldest du von dort, wo du gerade stehst — der Knopf liegt fest unten rechts, auf jedem Bildschirm der App. Das ist kein Detail: es ist der Unterschied zwischen „ich melde das nachher" und einer Anzeige mit dem richtigen Datum.
Wo das Diktat aufhört
Der wichtigste Satz steht als Kommentar über der Strecke, die aus einem Diktat eine Störung macht.
// POST /ai/voice-to-disruption — Voice-First Stoerungs-Draft (PROJ-90) // Erzeugt aus einem Diktat-Transkript einen Disruption-Draft-Vorschlag. // Persistiert NICHTS — Frontend ruft danach POST /disruptions mit dem Body.
Was das Diktat nicht leistet: Es funktioniert nicht offline — beide Wege brauchen eine Verbindung, und damit ist es die eine Stelle, an der Bidi das Netz voraussetzt. Wo gar kein Netz ist, tippst du; der Rest der App arbeitet dort weiter. Eine Aufnahme ist auf rund eine Minute begrenzt — länger ist auf der Baustelle ohnehin nicht praktikabel. Ohne hinterlegten Zugang zu einem Spracherkennungsdienst gibt es kein Diktat; die App sagt das dann und rät nicht. Das betrifft den Weg vom Ton zum Text. Die Felder füllt die KI auch dann, wenn du keinen eigenen Zugang hinterlegt hast. Und die Erkennung ist Erkennung: Namen, Bauteile und Zahlen liest du gegen, bevor du speicherst — genau dafür ist die Maske da.
Am lautesten Ort, den ihr habt
Diktat verkauft sich am Schreibtisch gut und fällt auf der Baustelle durch. Deshalb probieren wir es im Gespräch dort, wo es laut ist — mit deinen Begriffen, nicht mit unseren.
- Du schreibst zwei Zeilen, Frank meldet sich bei dir.
- Ihr diktiert einen echten Tagesbericht, in deiner Sprache.
- Danach weißt du, was das Modul kann und was nicht. Beides steht auf dieser Seite.