n8n · Telegram · WhatsApp · Threema · KI-Vision · Lexware
Leistungsbeschreibung aus Fotos
Ein Foto vom fertigen Auftrag über Telegram, WhatsApp oder Threema — die KI beschreibt die sichtbare Leistung und schickt einen fertigen Textvorschlag für die Rechnungsposition auf demselben Kanal zurück. Der Nutzer übernimmt ihn per Copy-&-Paste in die Lexware-Rechnung.
Das Problem
Die Rechnungsposition wird abends aus dem Kopf getippt
Nach dem Auftrag fehlt der Text zur erbrachten Leistung — er entsteht spät, wird vage oder gerät in Vergessenheit. Das beste Hilfsmittel, das Foto, bleibt ungenutzt.
Kostet Zeit am Abend
Der Text zur Leistung entsteht erst spät im Büro, aus dem Gedächtnis rekonstruiert.
Ungenau und knapp
„Diverse Arbeiten" statt einer sauberen, nachvollziehbaren Beschreibung der Leistung.
Foto ungenutzt
Das Baustellenfoto wäre die beste Vorlage — wird für die Rechnung aber nicht verwendet.
Die Lösung
Foto schicken — den fertigen Positionstext zurückbekommen
Ein Foto über Telegram, WhatsApp oder Threema, optional mit Bildunterschrift als Kontext. Die KI beschreibt die sichtbare Leistung, der Textvorschlag kommt auf demselben Kanal zum Übernehmen zurück.
Foto per Messenger
Der Monteur schickt das Foto über Telegram, WhatsApp oder Threema. Bildunterschrift optional als Zusatzkontext.
KI beschreibt die Leistung
Eine Vision-KI formuliert eine knappe, sachliche Rechnungsposition zur sichtbaren Arbeit — Cloud oder lokal.
Antwort auf demselben Kanal
Der Messenger-Baustein schickt den Text auf demselben Kanal zurück; Übernahme per Copy & Paste in die Lexware-Rechnung.
So sieht es aus
Der Vorschlag im Chat
Der Rechnungs-Bot schickt den von der KI erzeugten Positionstext auf demselben Kanal zurück — sauber formatiert, zum Markieren und Übernehmen. Gerenderte Produktansicht mit gekennzeichneten Beispieldaten, stellvertretend für alle drei Kanäle.
Hauptfunktionen
Was der Workflow leistet
Alle aktiven Funktionen sind einsatzbereit.
Foto-Empfang über drei Messenger
Nimmt das Foto aus Telegram, WhatsApp oder Threema entgegen und liest eine optionale Bildunterschrift als Kontext.
EinsatzbereitNormalisieren
Alle drei Kanäle werden auf eine einheitliche Form gebracht und laufen durch denselben Ablauf.
EinsatzbereitVision-Anfrage
POST an eine OpenAI-kompatible KI, Cloud oder lokal. System-Prompt bittet um eine knappe, sachliche Position.
EinsatzbereitAntwort auf demselben Kanal
Der zentrale Messenger-Baustein schickt den Textvorschlag an den Absender zurück — über den Kanal, von dem das Foto kam.
EinsatzbereitFoto-Wächter
Nachrichten ohne verwertbares Foto werden erkannt und übersprungen.
EinsatzbereitRechnung schreiben — bewusst aus
Der direkte PUT-Weg in Lexware ist als deaktivierte Node-Insel vorbereitet, nicht aktiv.
DeaktiviertTypischer Ablauf
Vom Foto bis zum Textvorschlag
- Foto schickenMonteur schickt das Foto vom fertigen Auftrag über Telegram, WhatsApp oder Threema, optional mit Bildunterschrift.
- Normalisieren & vorbereitenDer Eingang wird vereinheitlicht und das Foto als base64-data-URL für die KI verpackt.
- KI beschreibt die LeistungDie Vision-KI formuliert eine knappe, sachliche Rechnungsposition — Cloud oder lokal.
- Vorschlag übernehmenDer Text kommt auf demselben Kanal zurück und wird in die Lexware-Rechnung eingefügt.
Architektur
Drei Messenger rein — Antwort auf demselben Kanal zurück
version — ein Fehler überschreibt die Rechnung. Er ist deshalb als deaktivierte Node-Insel vorbereitet, nicht mit der aktiven Kette verbunden.Datenschutz und Sicherheit
Foto und Text — kontrolliert verarbeitet
Verarbeitete Daten
Baustellenfoto, optionale Bildunterschrift und der erzeugte Beschreibungstext. Fotos können personenbezogene Inhalte zeigen.
Empfänger
Die eigene n8n-Instanz, der genutzte Messenger (Telegram/WhatsApp/Threema) und der gewählte KI-Dienst. Ein lokales Vision-Modell ist über dieselbe Struktur möglich (datensparsam), die Cloud-KI ebenso.
Nichts wird geschrieben
Der aktive Weg schreibt nichts in Lexware — er gibt nur einen Textvorschlag zurück. Das Übernehmen bleibt beim Menschen.
Zu bedenken
Foto und Text laufen über einen KI-Dienst. Das gehört in die Datenschutz-Betrachtung des Betriebs. Der Bot kann auf bekannte Absender beschränkt werden.
Technik-Stack
Womit es gebaut ist
Nutzen und Projektstatus
Was es bringt
Text sofort da
Der Positionstext entsteht direkt am Foto, nicht abends aus dem Gedächtnis.
Sauber und einheitlich
Knappe, sachliche Formulierung statt „diverse Arbeiten".
Kein Lernaufwand
Der Monteur schickt nur ein Foto über den Messenger, den er ohnehin nutzt. Die Antwort kommt auf demselben Kanal.
Sicher gebaut
Nichts wird automatisch in Lexware geschrieben — der Mensch übernimmt den Text.
FlowTrix
Prozess automatisieren?
Wir bauen solche Workflows passgenau auf Ihre Systeme.