FlowTrix Showcase

n8n · Telegram · WhatsApp · Threema · KI-Vision · Lexware

Leistungsbeschreibung aus Fotos

Ein Foto vom fertigen Auftrag über Telegram, WhatsApp oder Threema — die KI beschreibt die sichtbare Leistung und schickt einen fertigen Textvorschlag für die Rechnungsposition auf demselben Kanal zurück. Der Nutzer übernimmt ihn per Copy-&-Paste in die Lexware-Rechnung.

n8n (selbst gehostet) Telegram WhatsApp Threema Vision-KI (Cloud oder lokal) Lexware-Rechnung
Wie es funktioniert Ansehen
Status: Einsatzbereit. Drei Messenger als Eingang (Telegram, WhatsApp, Threema), Bildbeschreibung über eine Vision-KI (Cloud oder lokal umschaltbar), Antwort auf demselben Kanal zurück über den zentralen Messenger-Baustein.
Telegram-Nachricht des Rechnungs-Bots mit einem KI-Vorschlag für die Rechnungsposition

Das Problem

Die Rechnungsposition wird abends aus dem Kopf getippt

Nach dem Auftrag fehlt der Text zur erbrachten Leistung — er entsteht spät, wird vage oder gerät in Vergessenheit. Das beste Hilfsmittel, das Foto, bleibt ungenutzt.

🌙

Kostet Zeit am Abend

Der Text zur Leistung entsteht erst spät im Büro, aus dem Gedächtnis rekonstruiert.

🤏

Ungenau und knapp

„Diverse Arbeiten" statt einer sauberen, nachvollziehbaren Beschreibung der Leistung.

📷

Foto ungenutzt

Das Baustellenfoto wäre die beste Vorlage — wird für die Rechnung aber nicht verwendet.

Die Lösung

Foto schicken — den fertigen Positionstext zurückbekommen

Ein Foto über Telegram, WhatsApp oder Threema, optional mit Bildunterschrift als Kontext. Die KI beschreibt die sichtbare Leistung, der Textvorschlag kommt auf demselben Kanal zum Übernehmen zurück.

📲

Foto per Messenger

Der Monteur schickt das Foto über Telegram, WhatsApp oder Threema. Bildunterschrift optional als Zusatzkontext.

🧠

KI beschreibt die Leistung

Eine Vision-KI formuliert eine knappe, sachliche Rechnungsposition zur sichtbaren Arbeit — Cloud oder lokal.

📋

Antwort auf demselben Kanal

Der Messenger-Baustein schickt den Text auf demselben Kanal zurück; Übernahme per Copy & Paste in die Lexware-Rechnung.

So sieht es aus

Der Vorschlag im Chat

Der Rechnungs-Bot schickt den von der KI erzeugten Positionstext auf demselben Kanal zurück — sauber formatiert, zum Markieren und Übernehmen. Gerenderte Produktansicht mit gekennzeichneten Beispieldaten, stellvertretend für alle drei Kanäle.

Rechnungs-Bot in Telegram: Vorschlag für eine Rechnungsposition mit Beschreibung, Hinweis zum Übernehmen und Beispiel-Kennzeichnung
Vorschlag des Rechnungs-Bots im Chat — Text zum Übernehmen in die Lexware-Rechnung.
Foto, Bildunterschrift und der erzeugte Text sind erfundene Beispieldaten. Gerenderte Produktansicht, kein echter Messenger-Screenshot.

Hauptfunktionen

Was der Workflow leistet

Alle aktiven Funktionen sind einsatzbereit.

📥

Foto-Empfang über drei Messenger

Nimmt das Foto aus Telegram, WhatsApp oder Threema entgegen und liest eine optionale Bildunterschrift als Kontext.

Einsatzbereit
🔀

Normalisieren

Alle drei Kanäle werden auf eine einheitliche Form gebracht und laufen durch denselben Ablauf.

Einsatzbereit
🧠

Vision-Anfrage

POST an eine OpenAI-kompatible KI, Cloud oder lokal. System-Prompt bittet um eine knappe, sachliche Position.

Einsatzbereit
📤

Antwort auf demselben Kanal

Der zentrale Messenger-Baustein schickt den Textvorschlag an den Absender zurück — über den Kanal, von dem das Foto kam.

Einsatzbereit
🛡️

Foto-Wächter

Nachrichten ohne verwertbares Foto werden erkannt und übersprungen.

Einsatzbereit
🔒

Rechnung schreiben — bewusst aus

Der direkte PUT-Weg in Lexware ist als deaktivierte Node-Insel vorbereitet, nicht aktiv.

Deaktiviert

Typischer Ablauf

Vom Foto bis zum Textvorschlag

  1. Foto schickenMonteur schickt das Foto vom fertigen Auftrag über Telegram, WhatsApp oder Threema, optional mit Bildunterschrift.
  2. Normalisieren & vorbereitenDer Eingang wird vereinheitlicht und das Foto als base64-data-URL für die KI verpackt.
  3. KI beschreibt die LeistungDie Vision-KI formuliert eine knappe, sachliche Rechnungsposition — Cloud oder lokal.
  4. Vorschlag übernehmenDer Text kommt auf demselben Kanal zurück und wird in die Lexware-Rechnung eingefügt.

Architektur

Drei Messenger rein — Antwort auf demselben Kanal zurück

Telegram / WhatsApp / Threema (Foto) Normalisieren Bild vorbereiten Vision-Anfrage Messenger-Baustein: Antwort auf demselben Kanal
Rechnung lesen Position anhängen PUT /invoices/{id} — deaktiviert
Ein Eingang je Kanal, ein gemeinsamer Ablauf, Antwort zurück auf demselben Kanal. Nach der Normalisierung laufen alle drei Messenger durch dieselbe Kette; der zentrale Messenger-Baustein schickt den Vorschlag an den Absender zurück. Der direkte Schreibweg in Lexware (Rechnungsposition per PUT) kennt nur Full-Replacement des gesamten Rechnungsobjekts inkl. version — ein Fehler überschreibt die Rechnung. Er ist deshalb als deaktivierte Node-Insel vorbereitet, nicht mit der aktiven Kette verbunden.

Datenschutz und Sicherheit

Foto und Text — kontrolliert verarbeitet

Verarbeitete Daten

Baustellenfoto, optionale Bildunterschrift und der erzeugte Beschreibungstext. Fotos können personenbezogene Inhalte zeigen.

Empfänger

Die eigene n8n-Instanz, der genutzte Messenger (Telegram/WhatsApp/Threema) und der gewählte KI-Dienst. Ein lokales Vision-Modell ist über dieselbe Struktur möglich (datensparsam), die Cloud-KI ebenso.

Nichts wird geschrieben

Der aktive Weg schreibt nichts in Lexware — er gibt nur einen Textvorschlag zurück. Das Übernehmen bleibt beim Menschen.

Zu bedenken

Foto und Text laufen über einen KI-Dienst. Das gehört in die Datenschutz-Betrachtung des Betriebs. Der Bot kann auf bekannte Absender beschränkt werden.

Ehrlich eingeordnet: Der aktive Weg schreibt nichts in Lexware — er gibt nur einen Textvorschlag zurück, den der Mensch übernimmt.

Technik-Stack

Womit es gebaut ist

n8n (selbst gehostet) Telegram Bot API WhatsApp Business Cloud (Graph API) Threema-Gateway Messenger-Baustein Vision-KI (Cloud oder lokal) HTTP Header Auth Lexware (nur deaktivierter PUT-Weg) JavaScript (Code-Nodes)

Nutzen und Projektstatus

Was es bringt

Text sofort da

Der Positionstext entsteht direkt am Foto, nicht abends aus dem Gedächtnis.

Sauber und einheitlich

Knappe, sachliche Formulierung statt „diverse Arbeiten".

Kein Lernaufwand

Der Monteur schickt nur ein Foto über den Messenger, den er ohnehin nutzt. Die Antwort kommt auf demselben Kanal.

Sicher gebaut

Nichts wird automatisch in Lexware geschrieben — der Mensch übernimmt den Text.

Status: Einsatzbereit — drei Messenger als Eingang, Vision-KI Cloud oder lokal, Antwort auf demselben Kanal zurück. Belastbare Kennzahlen liegen nicht vor; alle Angaben in den Ansichten sind Beispielwerte.

FlowTrix

Prozess automatisieren?

Wir bauen solche Workflows passgenau auf Ihre Systeme.