Mit dem wachsenden Interesse an Smart Homes ist es möglich geworden, die Identität von Personen zu kennen, die an die Tür klopfen, ohne diese öffnen zu müssen. Mithilfe von Home Assistant und KI-Technologien kann ein System eingerichtet werden, das Personen anhand von Video- und Audioanalysen identifiziert, die Sicherheit erhöht und ein neues Maß an Komfort bietet. Diese Technologie kann mit Kameras und Sensoren verbunden werden, um sofortige Benachrichtigungen mit einer genauen Beschreibung der Person an der Tür zu senden.

Zusammenfassung
- Home Assistant verwendet Google Gemini, um anhand eines Schnappschusses der Video-Türklingel zu beschreiben, wer an die Tür klopft.
- Sie müssen LLM Vision installieren, einen Google Gemini API-Schlüssel erhalten und die Home Assistant-App für Benachrichtigungen verwenden.
- LLM Vision kann auch für andere Zwecke verwendet werden, beispielsweise zum Zählen geparkter Autos.
Als intelligente Chatbots erstmals auftauchten, waren sie auf die Texteingabe beschränkt. Die einzige Möglichkeit, eine Antwort vom Chatbot zu erhalten, bestand darin, eine Antwort einzugeben. Heutzutage sind viele KI-Modelle multimodal, das heißt, sie können mehr als nur Text verarbeiten.
Mithilfe von KI können Sie jetzt beispielsweise Bilder analysieren und detaillierte Beschreibungen des Bildinhalts erstellen. Möglicherweise könnte Home Assistant diese Fähigkeit nutzen, um anhand eines Bildes der Video-Türklingel zu beschreiben, wer an die Tür klopft, was oft zu urkomischen Ergebnissen führt.
Was Sie benötigen
Wenn Sie Home Assistant bereits verwenden und Ihre intelligente Video-Türklingel verbunden ist, haben Sie wahrscheinlich bereits das meiste eingerichtet, was Sie brauchen. Sie müssen Home Assistant aktiviert haben und Ihre Video-Türklingel über die Integration hinzufügen. Home Assistant macht ein Foto Ihrer Türklingel und sendet es zur Analyse an Google Gemini. Dadurch wird eine Beschreibung der Person erstellt, die an Ihre Tür klopft.

Sie müssen die LLM Vision-Integration installieren. Bei dieser Integration handelt es sich um eine Home Assistant-Integration, die ein Bild der Türklingel aufnimmt, es zur Analyse an Gemini weiterleitet und die Antwort dann in einer Variable speichert, die Sie in Home Assistant verwenden können.
Sie benötigen außerdem einen Google Gemini API-Schlüssel, der Ihnen die Verwendung von Gemini-Modellen zur Analyse Ihrer Bilder ermöglicht. Ich verwende Google Gemini, weil es im Gegensatz zu den meisten anderen Modellen eine kostenlose API-Nutzung bietet. Sie benötigen jedoch ein Google-Konto, um Ihren API-Schlüssel zu erstellen.
Um Benachrichtigungen auf Ihrem Telefon zu erhalten, müssen Sie die Home Assistant-App auf Ihrem Telefon installieren und sie mit dem Home Assistant-Server verbinden. Ihr Telefon wird dann als Ziel für von Home Assistant gesendete Benachrichtigungen angezeigt.
Generieren Sie einen API-Schlüssel für Google Gemini
Das Generieren eines API-Schlüssels ist mit Google AI Studio sehr einfach und schnell. Gehen Sie zur Google AI Studio-Website und melden Sie sich bei Ihrem Google-Konto an. Klicken Sie auf die Schaltfläche „API-Schlüssel abrufen“ und dann auf „API-Schlüssel generieren“. Ein eindeutiger API-Schlüssel wird generiert und in Ihrem Google-Konto gespeichert, sodass Sie später bei Bedarf darauf zugreifen können. Sie können jederzeit auf die Schaltfläche „Kopieren“ klicken, um Ihren API-Schlüssel zu kopieren.



Lassen Sie Google AI Studio nach der Generierung Ihres API-Schlüssels geöffnet, damit Sie den API-Schlüssel bei Bedarf kopieren können.
Installieren Sie die LLM Vision-Integration
Nachdem Sie Ihren API-Schlüssel haben, müssen Sie die LLM Vision-Integration installieren. Dies ist eine benutzerdefinierte Integration, die für Home Assistant entwickelt wurde. Entwickelt, um Ihnen die Analyse von Bildern, Videos und Live-Streams mithilfe multimedialer KI-Modelle zu ermöglichen. Die aus diesen Modellen extrahierten Informationen stehen dann im Home Assistant zur Verwendung in Automatisierungen zur Verfügung.
LLM Vision ist keine offizielle Integration, daher müssen Sie es über den Home Assistant Community Store (HACS) installieren. Dies ist eine Plattform zum Installieren benutzerdefinierter Home Assistant-Integrationen, die von der Community erstellt wurden und Funktionen bieten, die über den offiziellen Integrationssatz hinausgehen. Wenn Sie HACS nicht installiert haben, können Sie: Befolgen Sie die offiziellen Installationsanweisungen.
Öffnen Sie HACS nach der Installation und suchen Sie nach LLM Vision. Wählen Sie die LLM Vision-Integration aus und klicken Sie auf die Schaltfläche „Herunterladen“, um sie herunterzuladen. Starten Sie Home Assistant neu.



LLM Vision-Einrichtung
Nach der Installation der LLM Vision-Integration müssen Sie sie zu Home Assistant hinzufügen und mit dem von Ihnen generierten API-Schlüssel einrichten.
Gehen Sie nach dem Neustart von Home Assistant zu Einstellungen > Geräte und Dienste. Klicken Sie auf der Registerkarte „Integrationen“ auf die Schaltfläche „Integration hinzufügen“, suchen Sie nach LLM und wählen Sie dann LLM Vision aus.



Wählen Sie in der Anbieterliste Google aus und klicken Sie auf „Senden“. Kopieren Sie Ihren Google Gemini API-Schlüssel, fügen Sie ihn in das Feld „API-Schlüssel“ ein und klicken Sie auf „Senden“.




LLM Vision ist jetzt so eingerichtet, dass es Google Gemini zur Analyse von Bildern von Ihrer Video-Türklingel verwendet.
Erstellen Sie eine Automatisierung zum Senden einer beschreibenden Benachrichtigung
Ich habe dies eingerichtet, um eine kurze Beschreibung darüber zu haben, wer an der Tür war, wenn jemand entdeckt wurde. Indem ich diese Benachrichtigung an mein Telefon schickte, konnte ich sehen, ob jemand ein Paket lieferte, meine Kinder draußen zum Spielen herumliefen oder sich jemand vor meinem Haus verdächtig verhielt. Und weil ich zur Beschreibung der Bilder generative KI verwendete, konnte ich sie auch bitten, ein wenig sarkastisch zu sein, um jedes Mal, wenn jemand an die Tür klopfte, für etwas Spaß zu sorgen.
Ich habe eine Automatisierung erstellt, die ausgelöst wird, wenn jemand an meiner Tür erkannt wird. Der genaue Auslöser variiert je nach Art der verwendeten Türklingel und den Ereignissen, die durch die Integration Ihrer Türklingel mit Home Assistant erkannt werden. In diesem Beispiel verwende ich eine Reolink-Türklingel. Bei manchen Video-Türklingeln, wie etwa den Modellen von Ring, kann die Einrichtung komplizierter sein, da sie nicht die einfache Aufnahme eines Schnappschusses des Kamera-Feeds ermöglichen.
Gehe zu Einstellungen > Automatisierung & Szenen. in Tab "Automatisierung", tippen Sie auf „Automatisierung erstellen“. dann wähle „Neue Automatisierung erstellen.“



tippen Sie auf Fügen Sie einen Katalysator hinzu Und wähle "das Gerät". Klicken Sie auf das Feld „Gerät“, geben Sie den Namen Ihrer Türklingel ein und wählen Sie sie dann aus den Ergebnissen aus. Klicken Sie auf das Dropdown-Menü „Trigger“ und wählen Sie einen Trigger aus, der Bewegungen erkennt. In diesem Beispiel mit einer Reolink-Türklingel verwende ich „Reolink-Haustürklingel aktiviert“.




Der nächste Schritt besteht darin, ein Bild der Szene von der Video-Türklingel aufzunehmen, sobald eine Bewegung erkannt wird. Dieses Standbild wird zur Analyse an das Gemini-Gerät gesendet und eine Beschreibung des Bildes wird angezeigt.
Klicken Sie auf die Schaltfläche „Aktion hinzufügen“, wählen Sie „Kamera“ und dann „Foto aufnehmen“. Klicken Sie auf die Schaltfläche „Gerät auswählen“ und wählen Sie Ihre Video-Türklingel aus. Geben Sie einen Pfad zum Speichern des Bildes ein. Ich werde die Bilder unter „/config/www/reolink_snapshot/last_snapshot_doorbell.jpg“ speichern und sie dann an LLM Vision senden.
Klicken Sie auf „Aktion hinzufügen“ und geben Sie „LLM“ ein. Wählen Sie aus den Ergebnissen „LLM Vision: Image Analyzer“ aus. Wählen Sie im Feld „Anbieter“ „Google Gemini“ aus. Wenn Sie ein effizienteres Modell verwenden möchten, geben Sie „gemini-1.5-pro“ in das Feld „Modell“ ein. Dies ist ein leistungsfähigeres Modell, ist jedoch auf 50 Bestellungen pro Tag beschränkt, verglichen mit 1500 Bestellungen pro Tag beim Standardmodell Gemini-1.5-Flash.

Geben Sie im Feld „Anspruch“ eine Aufforderung an Gemini ein, das Bild Ihrer Türklingel zu analysieren. Damit Ihre Kündigung nicht lange auf sich warten lässt, bitten Sie am besten um einen Satz. Ich habe um mutige Antworten gebeten, was es unterhaltsamer macht, aber Sie müssen nicht dasselbe tun. Meine Forderung war folgende:
Beschreiben Sie das Bild in einem Satz. Wenn Sie jemanden sehen, beschreiben Sie ihn. Wenn Sie mehrere Personen sehen, zählen Sie deren Anzahl und beschreiben Sie sie. Versuchen Sie festzustellen, ob sie kommen oder gehen, und geben Sie, wenn möglich, an, welches von beiden. Formulieren Sie die Beschreibung etwas fett.
Geben Sie im Feld „Bilddatei“ den Speicherort des Schnappschusses ein, den Sie in den vorherigen Schritten erstellt haben. Geben Sie im Feld „Antwortvariable“ einen Namen für die Antwort von Gemini ein. Sie werden auf diesen Namen verweisen, um die Antwort zu Ihrer Benachrichtigung hinzuzufügen. Ich verwende „Türklingelbeschreibung“.

Klicken Sie auf „Aktion hinzufügen“, geben Sie „Benachrichtigung“ ein und wählen Sie dann die Option zum Senden einer Benachrichtigung an Ihr Mobiltelefon. Damit diese Option angezeigt wird, muss die mobile App installiert sein. Geben Sie im Datenfeld „image: /local/“ gefolgt vom Ordnernamen und Dateinamen des Türklingelbildes ein. In diesem Beispiel gebe ich im Feld „Daten“ Folgendes ein:
"Bild: /local/reolink_snapshot/last_snapshot_doorbell.jpg"
Wählen Sie das Feld „Nachricht“ aus und beginnen Sie mit der Eingabe von „{{“. Daraufhin wird eine Meldung angezeigt, die besagt, dass der visuelle Editor diese Konfiguration nicht unterstützt. Löschen Sie im Code unter dieser Nachricht den vorhandenen Text und ersetzen Sie ihn durch Folgendes:
"{{doorbell_description.response_text}}"
Achten Sie darauf, am Anfang und Ende Anführungszeichen einzufügen. Ersetzen Sie „doorbell_description“ durch den Namen, den Sie für die Antwort in der LLM Vision-Aktion verwendet haben.
Klicken Sie auf „Speichern“, benennen Sie die Automatisierung und klicken Sie dann erneut auf „Speichern“. Laufen Sie jetzt nach draußen und stellen Sie sich vor die Video-Türklingel.
Wenn alles richtig eingerichtet ist, sollten Sie auf Ihrem Telefon eine Benachrichtigung mit einem Schnappschuss der Türklingel und einer Beschreibung der Szene erhalten.

Andere Möglichkeiten zur Verwendung von LLM Vision
Die obige Methode sendet eine Benachrichtigung zur Identifizierung des Besuchers an der Tür, auch wenn es nicht an der Tür klingelt. Diese Methode ist nützlich, um zu wissen, wann Personen das Haus verlassen haben, ob sich jemand in der Nähe Ihrer Haustür befindet, ohne zu klingeln, oder sogar, ob jemand ein Paket vor Ihrer Tür abgestellt hat.
Möglicherweise möchten Sie jedoch nur dann eine Benachrichtigung erhalten, wenn es an der Tür klingelt. In diesem Fall können Sie dieselbe Automatisierung erstellen, aber anstatt den Alarm auszulösen, wenn eine Bewegung erkannt wird, können Sie einen „Vom Besucher ausgelösten“ Alarm verwenden, der nur aktiviert wird, wenn es an der Tür klingelt.

Ich habe ein separates Automatisierungssystem eingerichtet, das erkennt, wenn es an der Tür klingelt, und nicht nur, wenn jemand anwesend ist. Wenn es an der Tür klingelt, macht das System einen Schnappschuss, analysiert das Bild mithilfe von LLM Vision und meldet dann über die intelligenten Lautsprecher meines Zuhauses, dass jemand an der Tür ist, mit der von LLM Vision generierten Beschreibung.
So kann ich mir, auch wenn ich mein Telefon nicht dabei habe, eine Beschreibung der Person anzeigen lassen, die klingelt.
LLM Vision kann aber noch viel mehr. Es kann auch Videodateien und Live-Streams analysieren und sogar Sensoren anhand von Bildern aktualisieren. Sie können beispielsweise einen Datenanalysten damit beauftragen, die Anzahl der vor Ihrem Haus geparkten Autos zu zählen und eine Automatisierung auszulösen, wenn diese Zahl einen bestimmten Wert erreicht oder unterschreitet.
Führen Sie LLM Vision lokal aus
In diesem Beispiel habe ich die kostenlose Version von Google Gemini zur Analyse der Bilder verwendet. Es ist schnell, einigermaßen genau und die Nutzung ist für eine begrenzte Anzahl von Besuchen bei mir kostenlos. Möglicherweise gefällt Ihnen die Idee nicht, Fotos von Personen, die an Ihre Tür kommen, an die Cloud zu senden, auch wenn Video-Türklingeln wie Ring dies standardmäßig tun.
Wenn ja und Sie über ausreichend leistungsstarke Hardware verfügen, können Sie ein LLM-Programm auf Ihrem lokalen Computer hosten und alle Analysen lokal durchführen. Es gibt lokale Modelle des LLM-Programms, die auf weniger leistungsstarken Computern laufen, aber sie werden Schwierigkeiten haben, die Bildanalyse schnell genug durchzuführen, um nützlich zu sein.
Vision LLM unterstützt beliebte Self-Hosting-Optionen wie Ollama, Open WebUI und LocalAI, die es Ihnen ermöglichen, Modelle wie Gemma3 und Llama3.2vision zur Durchführung von Analysen zu verwenden.


