<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="de">
	<id>https://mediawiki.wissen-ahrensburg.de/index.php?action=history&amp;feed=atom&amp;title=Wissen_%2F_Daten_%2F_Datenbanken</id>
	<title>Wissen / Daten / Datenbanken - Versionsgeschichte</title>
	<link rel="self" type="application/atom+xml" href="https://mediawiki.wissen-ahrensburg.de/index.php?action=history&amp;feed=atom&amp;title=Wissen_%2F_Daten_%2F_Datenbanken"/>
	<link rel="alternate" type="text/html" href="https://mediawiki.wissen-ahrensburg.de/index.php?title=Wissen_/_Daten_/_Datenbanken&amp;action=history"/>
	<updated>2026-08-19T23:04:01Z</updated>
	<subtitle>Versionsgeschichte dieser Seite in Dokument</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://mediawiki.wissen-ahrensburg.de/index.php?title=Wissen_/_Daten_/_Datenbanken&amp;diff=3611&amp;oldid=prev</id>
		<title>imported&gt;Thorsten Klöhn: Import aus Zensical-Doku (Wissen Ahrensburg)</title>
		<link rel="alternate" type="text/html" href="https://mediawiki.wissen-ahrensburg.de/index.php?title=Wissen_/_Daten_/_Datenbanken&amp;diff=3611&amp;oldid=prev"/>
		<updated>2026-07-17T23:33:17Z</updated>

		<summary type="html">&lt;p&gt;Import aus Zensical-Doku (Wissen Ahrensburg)&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Neue Seite&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&amp;lt;span id=&amp;quot;datenbanken--big-data-übersicht-für-ki-anwendungen&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
= Datenbanken &amp;amp;amp; Big Data: Übersicht für KI-Anwendungen =&lt;br /&gt;
&lt;br /&gt;
Eine zentralisierte Übersicht über Datenbanken, Big-Data-Technologien und Datenpipelines speziell für künstliche Intelligenz, Machine Learning und datenintensive Anwendungen.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;file_cabinet-datenbank-landschaft-für-ki&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
== 🗄️ Datenbank-Landschaft für KI ==&lt;br /&gt;
&lt;br /&gt;
Moderne KI-Anwendungen benötigen spezielle Datenbanklösungen für verschiedene Anforderungen: von der Speicherung von Vektoren für semantische Suche bis hin zu Echtzeit-Datenpipelines für Training und Inference.&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;datenbank-kategorien-im-überblick&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== Datenbank-Kategorien im Überblick ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Kategorie&lt;br /&gt;
! Beschreibung&lt;br /&gt;
! Typische Anwendungen&lt;br /&gt;
! Beispiele&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Vektordatenbanken&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Speicherung und Abfrage von Vektoren (Embeddings)&lt;br /&gt;
| Semantische Suche, RAG, Ähnlichkeitsvergleich&lt;br /&gt;
| Milvus, Weaviate, Qdrant, Pinecone&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Zeitreihendatenbanken&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Optimiert für zeitliche Daten&lt;br /&gt;
| IoT, Monitoring, Vorhersagen&lt;br /&gt;
| InfluxDB, TimescaleDB, Prometheus&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Graphdatenbanken&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Speicherung von Beziehungen und Netzwerken&lt;br /&gt;
| Wissensgraphen, Empfehlungssysteme&lt;br /&gt;
| Neo4j, Amazon Neptune, Dgraph&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Dokumentendatenbanken&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Flexible JSON-Speicherung&lt;br /&gt;
| Unstrukturierte Daten, Content&lt;br /&gt;
| MongoDB, Elasticsearch, CouchDB&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Relationale Datenbanken&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Tabellenbasierte Speicherung&lt;br /&gt;
| Strukturierte Daten, Transaktionen&lt;br /&gt;
| PostgreSQL, MySQL, SQLite&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Key-Value Stores&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Einfache Schlüssel-Wert-Speicherung&lt;br /&gt;
| Caching, Session-Speicherung&lt;br /&gt;
| Redis, DynamoDB, etcd&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Columnar Stores&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Spaltenorientierte Speicherung&lt;br /&gt;
| Analytische Abfragen, Data Warehousing&lt;br /&gt;
| ClickHouse, Apache Cassandra&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Data Lakes&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Speicherung großer Mengen roher Daten&lt;br /&gt;
| Big Data, Data Science&lt;br /&gt;
| MinIO, Ceph, Hadoop HDFS&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;books-hauptthemen&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
== 📚 Hauptthemen ==&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;1-vektordatenbanken-vector-databases&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== 1. Vektordatenbanken (Vector Databases) ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Speicherung und effiziente Abfrage von hochdimensionalen Vektoren (Embeddings) für KI-Anwendungen.&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Anwendungsbereiche&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** Semantische Suche in großen Dokumentenbeständen&lt;br /&gt;
** Retrieval-Augmented Generation (RAG) für LLMs&lt;br /&gt;
** Ähnlichkeitsvergleich (Nearest Neighbor Search)&lt;br /&gt;
** Empfehlungssysteme basierend auf Vektorähnlichkeit&lt;br /&gt;
** Clusteranalyse und Anomalie-Erkennung&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Schlüsselkonzepte&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Embeddings&amp;#039;&amp;#039;&amp;#039;: Vektordarstellungen von Text, Bildern, Audio&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;ANN (Approximate Nearest Neighbor)&amp;#039;&amp;#039;&amp;#039;: Effiziente Suche in hochdimensionalen Räumen&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Index-Typen&amp;#039;&amp;#039;&amp;#039;: HNSW, IVF, LSH, PQ&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Vektordimension&amp;#039;&amp;#039;&amp;#039;: Typischerweise 384-4096 Dimensionen&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Vektordatenbanken im Vergleich&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Datenbank&lt;br /&gt;
! Open Source&lt;br /&gt;
! Cloud-Hosted&lt;br /&gt;
! Besonderheiten&lt;br /&gt;
! ANN-Algorithmen&lt;br /&gt;
! Skalierbarkeit&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Milvus&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅ (Zilliz Cloud)&lt;br /&gt;
| CNCF-Projekt, beliebt&lt;br /&gt;
| HNSW, IVF, LSH&lt;br /&gt;
| ⭐⭐⭐⭐⭐&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Weaviate&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅ (Weaviate Cloud)&lt;br /&gt;
| Integrierte NLP-Module&lt;br /&gt;
| HNSW, LSH&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Qdrant&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅&lt;br /&gt;
| Rust-basiert, schnell&lt;br /&gt;
| HNSW, Product Quantization&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Pinecone&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ❌&lt;br /&gt;
| ✅&lt;br /&gt;
| Managed Service&lt;br /&gt;
| HNSW&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Chroma&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| Python-zentriert, einfach&lt;br /&gt;
| HNSW&lt;br /&gt;
| ⭐⭐⭐&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Faiss&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| Facebook, Low-Level&lt;br /&gt;
| IVF, LSH, PQ&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Annoy&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| Spotify, für Musik-Empfehlungen&lt;br /&gt;
| Random Projections&lt;br /&gt;
| ⭐⭐⭐&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;2-zeitreihendatenbanken-time-series-databases&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== 2. Zeitreihendatenbanken (Time Series Databases) ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Optimiert für die Speicherung, Abfrage und Analyse von zeitlichen Daten.&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Anwendungsbereiche&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** IoT-Daten (Sensoren, Geräte)&lt;br /&gt;
** Monitoring und Metriken&lt;br /&gt;
** Finanzdaten (Kurse, Transaktionen)&lt;br /&gt;
** Vorhersage und Predictive Maintenance&lt;br /&gt;
** Echtzeit-Analyse&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Schlüsselkonzepte&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Retention Policies&amp;#039;&amp;#039;&amp;#039;: Automatisches Löschen alter Daten&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Downsampling&amp;#039;&amp;#039;&amp;#039;: Aggregation für verschiedene Zeitintervalle&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Continuous Queries&amp;#039;&amp;#039;&amp;#039;: Echtzeit-Aggregation&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Time Partitioning&amp;#039;&amp;#039;&amp;#039;: effiziente Speicherung nach Zeit&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Zeitreihendatenbanken im Vergleich&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Datenbank&lt;br /&gt;
! Open Source&lt;br /&gt;
! Cloud-Hosted&lt;br /&gt;
! Besonderheiten&lt;br /&gt;
! Abfragesprache&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;InfluxDB&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅ (InfluxDB Cloud)&lt;br /&gt;
| Hochperformant, Flux-Sprache&lt;br /&gt;
| Flux, SQL&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;TimescaleDB&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅&lt;br /&gt;
| PostgreSQL-Erweiterung&lt;br /&gt;
| SQL&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Prometheus&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| Monitoring, Alerting&lt;br /&gt;
| PromQL&lt;br /&gt;
|-&lt;br /&gt;
| ** VictoriaMetrics**&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅&lt;br /&gt;
| Kompatibel mit Prometheus&lt;br /&gt;
| PromQL, MetricsQL&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;QuestDB&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅&lt;br /&gt;
| SQL + Zeitreihen&lt;br /&gt;
| SQL, InfluxDB Line Protocol&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Druid&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| Echtzeit-Analytik&lt;br /&gt;
| SQL&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;3-graphdatenbanken&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== 3. Graphdatenbanken ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Speicherung und Abfrage von stark vernetzten Daten als Graphen.&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Anwendungsbereiche&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** Wissensgraphen für KI-Systeme&lt;br /&gt;
** Empfehlungssysteme (Social Graphs)&lt;br /&gt;
** Betrugserkennung (Transaktionsnetzwerke)&lt;br /&gt;
** Netzwerkanalyse (Soziale Netzwerke, IT-Infrastruktur)&lt;br /&gt;
** Biowissenschaften (Protein-Interaktionen, Gen-Netzwerke)&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Schlüsselkonzepte&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Knoten (Nodes)&amp;#039;&amp;#039;&amp;#039;: Entitäten im Graphen&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Kanten (Edges)&amp;#039;&amp;#039;&amp;#039;: Beziehungen zwischen Knoten&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Eigenschaften (Properties)&amp;#039;&amp;#039;&amp;#039;: Attribute von Knoten und Kanten&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Graph-Algorithmen&amp;#039;&amp;#039;&amp;#039;: Pfadsuche, Community Detection, PageRank&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Graphdatenbanken im Vergleich&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Datenbank&lt;br /&gt;
! Open Source&lt;br /&gt;
! Cloud-Hosted&lt;br /&gt;
! Abfragesprache&lt;br /&gt;
! Besonderheiten&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Neo4j&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅ (AuraDB)&lt;br /&gt;
| Cypher&lt;br /&gt;
| Markführer, beliebte API&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Amazon Neptune&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ❌&lt;br /&gt;
| ✅&lt;br /&gt;
| Gremlin, SPARQL, openCypher&lt;br /&gt;
| AWS-integriert&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;ArangoDB&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅&lt;br /&gt;
| AQL&lt;br /&gt;
| Multi-Model (Dokumente + Graph)&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Dgraph&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ✅&lt;br /&gt;
| GraphQL+-&lt;br /&gt;
| Distribuiert, skalierbar&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;JanusGraph&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| Gremlin&lt;br /&gt;
| Apache TinkerPop&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;TigerGraph&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| ❌&lt;br /&gt;
| ✅&lt;br /&gt;
| GSQL&lt;br /&gt;
| Parallel Graph Computing&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;4-relationale-datenbanken-für-ki&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== 4. Relationale Datenbanken für KI ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Traditionelle SQL-Datenbanken mit KI-spezifischen Erweiterungen.&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Anwendungsbereiche&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** Strukturierte Daten für KI-Anwendungen&lt;br /&gt;
** Feature Stores für ML-Modelle&lt;br /&gt;
** Metadaten-Verwaltung&lt;br /&gt;
** Transaktionsdaten für Empfehlungssysteme&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;KI-spezifische Erweiterungen&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Datenbank&lt;br /&gt;
! KI-Erweiterung&lt;br /&gt;
! Beschreibung&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;PostgreSQL&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| pgvector&lt;br /&gt;
| Vektorspeicherung und ANN-Suche&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;PostgreSQL&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| pg_embedding&lt;br /&gt;
| Embeddings für PostgreSQL&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;PostgreSQL&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| PostGIS&lt;br /&gt;
| Räumliche Daten für Geodaten-KI&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;MySQL&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| MySQL Vector&lt;br /&gt;
| Vektorspeicherung&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;SQLite&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| sqlite-vss&lt;br /&gt;
| Vector Search Extension&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;5-nosql-datenbanken&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== 5. NoSQL-Datenbanken ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Flexible, schemafreie Datenbanken für unstrukturierte Daten.&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Dokumentendatenbanken&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;MongoDB&amp;#039;&amp;#039;&amp;#039;: JSON-Dokumente, flexible Schemas&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Elasticsearch&amp;#039;&amp;#039;&amp;#039;: Volltextsuche + Vektorsuche (ab 8.11)&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;CouchDB&amp;#039;&amp;#039;&amp;#039;: Master-Master Replikation&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Firebase Firestore&amp;#039;&amp;#039;&amp;#039;: Serverless, Echtzeit-Updates&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Key-Value Stores&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Redis&amp;#039;&amp;#039;&amp;#039;: In-Memory, extrem schnell, mit RediSearch für Volltextsuche&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;DynamoDB&amp;#039;&amp;#039;&amp;#039;: AWS-managed, skalierbar&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;etcd&amp;#039;&amp;#039;&amp;#039;: Verteilte Konfiguration&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Columnar Stores&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;ClickHouse&amp;#039;&amp;#039;&amp;#039;: Analytische Abfragen, extrem schnell&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Apache Cassandra&amp;#039;&amp;#039;&amp;#039;: Hochverfügbar, verteilt&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;ScyllaDB&amp;#039;&amp;#039;&amp;#039;: Cassandra-kompatibel, C++-basiert&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;6-data-lakes--objektspeicher&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== 6. Data Lakes &amp;amp;amp; Objektspeicher ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Speicherung großer Mengen roher Daten für Data Science und KI-Training.&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Anwendungsbereiche&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** Training großer Sprachmodelle&lt;br /&gt;
** Speicherung von Bild-, Audio-, Video-Datensätzen&lt;br /&gt;
** Data Warehousing für Analytik&lt;br /&gt;
** Backup und Archivierung&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Data-Lake-Lösungen&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Lösung&lt;br /&gt;
! Typ&lt;br /&gt;
! Open Source&lt;br /&gt;
! Cloud-Hosted&lt;br /&gt;
! Besonderheiten&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;MinIO&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Objektspeicher&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌ (Self-hosted)&lt;br /&gt;
| S3-kompatibel&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Ceph&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Distribuierter Speicher&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| Block, Object, File&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Hadoop HDFS&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Dateisystem&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| Big Data Standard&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;AWS S3&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Objektspeicher&lt;br /&gt;
| ❌&lt;br /&gt;
| ✅&lt;br /&gt;
| Markführer&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Google Cloud Storage&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Objektspeicher&lt;br /&gt;
| ❌&lt;br /&gt;
| ✅&lt;br /&gt;
| Hochintegriert mit GCP&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Azure Blob Storage&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Objektspeicher&lt;br /&gt;
| ❌&lt;br /&gt;
| ✅&lt;br /&gt;
| Microsoft Ökosystem&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Iceberg&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Table Format&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| ACID für Data Lakes&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Delta Lake&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Table Format&lt;br /&gt;
| ✅&lt;br /&gt;
| ❌&lt;br /&gt;
| Transaktionsfähigkeit&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;7-etl-tools--datenpipelines&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== 7. ETL-Tools &amp;amp;amp; Datenpipelines ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Tools für Extraktion, Transformation und Laden von Daten für KI-Anwendungen.&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;ETL-Tools&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Tool&lt;br /&gt;
! Typ&lt;br /&gt;
! Open Source&lt;br /&gt;
! Besonderheiten&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Airflow&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Workflow-Orchestrierung&lt;br /&gt;
| ✅&lt;br /&gt;
| DAG-basiert, sehr beliebt&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Dagster&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Workflow-Orchestrierung&lt;br /&gt;
| ✅&lt;br /&gt;
| Modern, type-safe&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Prefect&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Workflow-Orchestrierung&lt;br /&gt;
| ✅&lt;br /&gt;
| Python-zentriert&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Luigi&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Workflow-Orchestrierung&lt;br /&gt;
| ✅&lt;br /&gt;
| Spotify, einfach&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache NiFi&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Data Flow&lt;br /&gt;
| ✅&lt;br /&gt;
| GUI-basiert, Visualisierung&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;dbt (data build tool)&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Transformation&lt;br /&gt;
| ✅&lt;br /&gt;
| SQL-basiert&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Datenpipeline-Frameworks&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Framework&lt;br /&gt;
! Typ&lt;br /&gt;
! Open Source&lt;br /&gt;
! Besonderheiten&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Kafka&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Streaming&lt;br /&gt;
| ✅&lt;br /&gt;
| Echtzeit-Datenpipelines&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Spark&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Batch + Streaming&lt;br /&gt;
| ✅&lt;br /&gt;
| Verteilte Verarbeitung&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Flink&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Streaming&lt;br /&gt;
| ✅&lt;br /&gt;
| Stateful Stream Processing&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Beam&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Batch + Streaming&lt;br /&gt;
| ✅&lt;br /&gt;
| Unified Batch/Stream&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Ray&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Verteilte Berechnung&lt;br /&gt;
| ✅&lt;br /&gt;
| Python-zentriert, KI-Fokus&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Dask&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Parallel Computing&lt;br /&gt;
| ✅&lt;br /&gt;
| Python, Pandas-kompatibel&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;8-datenpipelines--streaming-für-ki&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== 8. Datenpipelines &amp;amp;amp; Streaming für KI ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Echtzeit-Datenverarbeitung für KI-Anwendungen.&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Streaming-Architekturen&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Kafka + Kafka Streams&amp;#039;&amp;#039;&amp;#039;: Echtzeit-Datenverarbeitung&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Kafka + Flink&amp;#039;&amp;#039;&amp;#039;: Komplexe Streaming-Jobs&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Kafka + Spark Streaming&amp;#039;&amp;#039;&amp;#039;: Batch + Streaming kombiniert&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Pulsar&amp;#039;&amp;#039;&amp;#039;: Multi-Tenancy, georepliziert&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Anwendungsfälle für KI&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Feature Store Updates&amp;#039;&amp;#039;&amp;#039;: Echtzeit-Aktualisierung von Features für ML-Modelle&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Model Serving&amp;#039;&amp;#039;&amp;#039;: Streaming-Inference für Echtzeit-Vorhersagen&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Datenaufbereitung&amp;#039;&amp;#039;&amp;#039;: Preprocessing-Pipelines für Training&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Monitoring&amp;#039;&amp;#039;&amp;#039;: Echtzeit-Metriken für KI-Systeme&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Beispiel-Architektur&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;9-big-data-frameworks&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== 9. Big Data Frameworks ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Frameworks für die Verarbeitung großer Datenmengen.&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Batch-Verarbeitung&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Apache Hadoop&amp;#039;&amp;#039;&amp;#039;: HDFS + MapReduce&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Apache Spark&amp;#039;&amp;#039;&amp;#039;: In-Memory, 100x schneller als Hadoop&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Apache Hive&amp;#039;&amp;#039;&amp;#039;: SQL für Hadoop&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Presto/Trino&amp;#039;&amp;#039;&amp;#039;: Distribuierte SQL-Query Engine&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Streaming-Verarbeitung&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Apache Kafka Streams&amp;#039;&amp;#039;&amp;#039;: Lightweight Streaming&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Apache Flink&amp;#039;&amp;#039;&amp;#039;: Low-Latency Stream Processing&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Apache Spark Streaming&amp;#039;&amp;#039;&amp;#039;: Micro-Batch Processing&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Data Warehousing&amp;#039;&amp;#039;&amp;#039;:&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Snowflake&amp;#039;&amp;#039;&amp;#039;: Cloud-native Data Warehouse&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Google BigQuery&amp;#039;&amp;#039;&amp;#039;: Serverless Analytics&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;Amazon Redshift&amp;#039;&amp;#039;&amp;#039;: Cloud Data Warehouse&lt;br /&gt;
** &amp;#039;&amp;#039;&amp;#039;ClickHouse&amp;#039;&amp;#039;&amp;#039;: Open-Source OLAP&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;hammer_and_wrench-praxisbeispiele&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
== 🛠️ Praxisbeispiele ==&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;beispiel-1-rag-system-mit-vektordatenbank&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== Beispiel 1: RAG-System mit Vektordatenbank ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Anforderungen:&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* Speicherung von Dokument-Embeddings&lt;br /&gt;
* Schnelle semantische Suche&lt;br /&gt;
* Integration mit LLM&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Lösung mit Qdrant:&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;syntaxhighlight lang=&amp;quot;python&amp;quot;&amp;gt;from qdrant_client import QdrantClient&lt;br /&gt;
from sentence_transformers import SentenceTransformer&lt;br /&gt;
&lt;br /&gt;
# 1. Qdrant-Client verbinden&lt;br /&gt;
client = QdrantClient(host=&amp;quot;localhost&amp;quot;, port=6333)&lt;br /&gt;
&lt;br /&gt;
# 2. Collection erstellen&lt;br /&gt;
client.create_collection(&lt;br /&gt;
    collection_name=&amp;quot;documents&amp;quot;,&lt;br /&gt;
    vectors_config={&amp;quot;size&amp;quot;: 384, &amp;quot;distance&amp;quot;: &amp;quot;Cosine&amp;quot;}&lt;br /&gt;
)&lt;br /&gt;
&lt;br /&gt;
# 3. Embeddings generieren&lt;br /&gt;
model = SentenceTransformer(&amp;#039;all-MiniLM-L6-v2&amp;#039;)&lt;br /&gt;
embeddings = model.encode(documents)&lt;br /&gt;
&lt;br /&gt;
# 4. Dokumente in Qdrant speichern&lt;br /&gt;
client.upsert(&lt;br /&gt;
    collection_name=&amp;quot;documents&amp;quot;,&lt;br /&gt;
    points=[&lt;br /&gt;
        {&amp;quot;id&amp;quot;: i, &amp;quot;vector&amp;quot;: embeddings[i], &amp;quot;payload&amp;quot;: {&amp;quot;text&amp;quot;: doc}}&lt;br /&gt;
        for i, doc in enumerate(documents)&lt;br /&gt;
    ]&lt;br /&gt;
)&lt;br /&gt;
&lt;br /&gt;
# 5. Semantische Suche&lt;br /&gt;
query_embedding = model.encode([query])&lt;br /&gt;
results = client.search(&lt;br /&gt;
    collection_name=&amp;quot;documents&amp;quot;,&lt;br /&gt;
    query_vector=query_embedding[0],&lt;br /&gt;
    limit=5&lt;br /&gt;
)&amp;lt;/syntaxhighlight&amp;gt;&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Empfohlene Datenbanken:&amp;#039;&amp;#039;&amp;#039; Qdrant, Milvus, Weaviate, Chroma&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;beispiel-2-echtzeit-monitoring-mit-timescaledb&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== Beispiel 2: Echtzeit-Monitoring mit TimescaleDB ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Anforderungen:&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* Speicherung von Metriken&lt;br /&gt;
* Echtzeit-Abfragen&lt;br /&gt;
* Aggregation über Zeit&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Lösung:&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;syntaxhighlight lang=&amp;quot;sql&amp;quot;&amp;gt;-- 1. Hypertable erstellen&lt;br /&gt;
SELECT create_hypertable(&amp;#039;metrics&amp;#039;, &amp;#039;time&amp;#039;);&lt;br /&gt;
&lt;br /&gt;
-- 2. Daten einfügen&lt;br /&gt;
INSERT INTO metrics (time, metric_name, value)&lt;br /&gt;
VALUES (now(), &amp;#039;cpu_usage&amp;#039;, 0.85);&lt;br /&gt;
&lt;br /&gt;
-- 3. Echtzeit-Aggregation&lt;br /&gt;
SELECT &lt;br /&gt;
    time_bucket(&amp;#039;1 hour&amp;#039;, time) as hour,&lt;br /&gt;
    metric_name,&lt;br /&gt;
    avg(value) as avg_value&lt;br /&gt;
FROM metrics&lt;br /&gt;
WHERE time &amp;gt; now() - interval &amp;#039;24 hours&amp;#039;&lt;br /&gt;
GROUP BY hour, metric_name&lt;br /&gt;
ORDER BY hour;&amp;lt;/syntaxhighlight&amp;gt;&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Empfohlene Datenbanken:&amp;#039;&amp;#039;&amp;#039; TimescaleDB, InfluxDB, Prometheus&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;beispiel-3-wissensgraph-mit-neo4j&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== Beispiel 3: Wissensgraph mit Neo4j ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Anforderungen:&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* Speicherung von Entitäten und Beziehungen&lt;br /&gt;
* Komplexe Graph-Abfragen&lt;br /&gt;
* Empfehlungen basierend auf Beziehungen&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Lösung:&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;syntaxhighlight lang=&amp;quot;cypher&amp;quot;&amp;gt;// 1. Knoten und Beziehungen erstellen&lt;br /&gt;
CREATE (alice:Person {name: &amp;#039;Alice&amp;#039;, age: 30})&lt;br /&gt;
CREATE (bob:Person {name: &amp;#039;Bob&amp;#039;, age: 25})&lt;br /&gt;
CREATE (alice)-[:FRIENDS_WITH]-&amp;gt;(bob)&lt;br /&gt;
CREATE (alice)-[:WORKS_AT]-&amp;gt;(company:Company {name: &amp;#039;Acme&amp;#039;})&lt;br /&gt;
&lt;br /&gt;
// 2. Freunden von Alice finden&lt;br /&gt;
MATCH (alice:Person {name: &amp;#039;Alice&amp;#039;})-[:FRIENDS_WITH]-&amp;gt;(friend)&lt;br /&gt;
RETURN friend.name&lt;br /&gt;
&lt;br /&gt;
// 3. Kurzesten Pfad finden&lt;br /&gt;
MATCH path = shortestPath(&lt;br /&gt;
    (a:Person {name: &amp;#039;Alice&amp;#039;})-[*]-&amp;gt;(b:Person {name: &amp;#039;Charlie&amp;#039;})&lt;br /&gt;
)&lt;br /&gt;
RETURN path&amp;lt;/syntaxhighlight&amp;gt;&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Empfohlene Datenbanken:&amp;#039;&amp;#039;&amp;#039; Neo4j, Dgraph, ArangoDB&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;beispiel-4-data-pipeline-mit-apache-airflow&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== Beispiel 4: Data Pipeline mit Apache Airflow ===&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Anforderungen:&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
* Automatisierte Datenpipeline&lt;br /&gt;
* Abhängigkeitsmanagement&lt;br /&gt;
* Fehlertoleranz&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Lösung (DAG-Datei):&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;syntaxhighlight lang=&amp;quot;python&amp;quot;&amp;gt;from airflow import DAG&lt;br /&gt;
from airflow.operators.python import PythonOperator&lt;br /&gt;
from datetime import datetime&lt;br /&gt;
&lt;br /&gt;
# 1. DAG definieren&lt;br /&gt;
dag = DAG(&lt;br /&gt;
    &amp;#039;data_pipeline&amp;#039;,&lt;br /&gt;
    start_date=datetime(2026, 1, 1),&lt;br /&gt;
    schedule_interval=&amp;#039;@daily&amp;#039;&lt;br /&gt;
)&lt;br /&gt;
&lt;br /&gt;
# 2. Tasks definieren&lt;br /&gt;
def extract_data():&lt;br /&gt;
    # Daten extrahieren&lt;br /&gt;
    pass&lt;br /&gt;
&lt;br /&gt;
def transform_data():&lt;br /&gt;
    # Daten transformieren&lt;br /&gt;
    pass&lt;br /&gt;
&lt;br /&gt;
def load_data():&lt;br /&gt;
    # Daten laden&lt;br /&gt;
    pass&lt;br /&gt;
&lt;br /&gt;
# 3. Tasks zum DAG hinzufügen&lt;br /&gt;
extract_task = PythonOperator(&lt;br /&gt;
    task_id=&amp;#039;extract&amp;#039;,&lt;br /&gt;
    python_callable=extract_data,&lt;br /&gt;
    dag=dag&lt;br /&gt;
)&lt;br /&gt;
&lt;br /&gt;
transform_task = PythonOperator(&lt;br /&gt;
    task_id=&amp;#039;transform&amp;#039;,&lt;br /&gt;
    python_callable=transform_data,&lt;br /&gt;
    dag=dag&lt;br /&gt;
)&lt;br /&gt;
&lt;br /&gt;
load_task = PythonOperator(&lt;br /&gt;
    task_id=&amp;#039;load&amp;#039;,&lt;br /&gt;
    python_callable=load_data,&lt;br /&gt;
    dag=dag&lt;br /&gt;
)&lt;br /&gt;
&lt;br /&gt;
# 4. Abhängigkeiten definieren&lt;br /&gt;
extract_task &amp;gt;&amp;gt; transform_task &amp;gt;&amp;gt; load_task&amp;lt;/syntaxhighlight&amp;gt;&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Empfohlene Tools:&amp;#039;&amp;#039;&amp;#039; Apache Airflow, Dagster, Prefect&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;robot-ki-agenten-tauglichkeit&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
== 🤖 KI-Agenten-Tauglichkeit ==&lt;br /&gt;
&lt;br /&gt;
Empfehlung, welche Datenbanken sich am besten für Automatisierung durch KI-Agenten eignen:&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Datenbank&lt;br /&gt;
! Kategorie&lt;br /&gt;
! Eignung&lt;br /&gt;
! Grund&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Qdrant&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Vektordatenbank&lt;br /&gt;
| ⭐⭐⭐⭐⭐&lt;br /&gt;
| REST API, einfache Integration, gute Dokumentation&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Milvus&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Vektordatenbank&lt;br /&gt;
| ⭐⭐⭐⭐⭐&lt;br /&gt;
| Python SDK, beliebt, gut dokumentiert&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Weaviate&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Vektordatenbank&lt;br /&gt;
| ⭐⭐⭐⭐⭐&lt;br /&gt;
| GraphQL API, integrierte NLP-Module&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Chroma&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Vektordatenbank&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
| Python-zentriert, einfach zu bedienen&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;PostgreSQL + pgvector&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Relational + Vektoren&lt;br /&gt;
| ⭐⭐⭐⭐⭐&lt;br /&gt;
| SQL + Vektorsuche, vertraut&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;SQLite + sqlite-vss&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Embedded + Vektoren&lt;br /&gt;
| ⭐⭐⭐⭐⭐&lt;br /&gt;
| Single-File, einfach, offline-fähig&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Redis&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Key-Value&lt;br /&gt;
| ⭐⭐⭐⭐⭐&lt;br /&gt;
| Einfache Befehle, extrem schnell&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;TimescaleDB&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Zeitreihen&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
| SQL-basiert, gut dokumentiert&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Neo4j&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Graphdatenbank&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
| Cypher-Abfragen, logisch strukturiert&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;InfluxDB&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Zeitreihen&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
| Flux/InfluxQL, für Metriken optimiert&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Kafka&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Streaming&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
| CLI-Tools, gut für Pipelines&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;Apache Airflow&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Workflow&lt;br /&gt;
| ⭐⭐⭐⭐⭐&lt;br /&gt;
| DAG-Definition in Python, sehr beliebt&lt;br /&gt;
|-&lt;br /&gt;
| &amp;#039;&amp;#039;&amp;#039;MongoDB&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
| Dokumentendatenbank&lt;br /&gt;
| ⭐⭐⭐⭐&lt;br /&gt;
| JSON-basiert, flexible Schemas&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;link-verwandte-themen&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
== 🔗 Verwandte Themen ==&lt;br /&gt;
&lt;br /&gt;
* [[KI &amp;amp; Automatisierung / Übersicht|KI-Modelle &amp;amp;amp; Frameworks]] – Modelle für KI-Anwendungen&lt;br /&gt;
* [[Entwicklung / Server &amp;amp; Infrastruktur / KI/ML-Infrastrukturen|KI/ML-Infrastrukturen]] – Infrastruktur für KI-Systeme&lt;br /&gt;
* [[Entwicklung / Server &amp;amp; Infrastruktur / Software-Übersicht|Server-Software]] – Server- und Datenbank-Konfiguration&lt;br /&gt;
* [[Wissen / Tools / Übersicht|Tools &amp;amp;amp; Hilfswerkzeuge]] – Entwicklungs- und Analyse-Tools&lt;br /&gt;
* [[Entwicklung / IDE &amp;amp; Tools / Lokale KI-Frontends|Lokale KI-Frontends]] – Web-UIs für lokale KI&lt;br /&gt;
* [[Wissen / Daten / Datenerfassung / Übersicht|Datenerfassung]] – Datenerfassungstools&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;open_book-weiterführende-ressourcen&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
== 📖 Weiterführende Ressourcen ==&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;offizielle-dokumentationen&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== Offizielle Dokumentationen ===&lt;br /&gt;
&lt;br /&gt;
* [https://milvus.io/docs Milvus Documentation] – Vektordatenbank&lt;br /&gt;
* [https://weaviate.io/developers/weaviate Weaviate Documentation] – Vektordatenbank&lt;br /&gt;
* [https://qdrant.tech/documentation/ Qdrant Documentation] – Vektordatenbank&lt;br /&gt;
* [https://neo4j.com/docs/ Neo4j Documentation] – Graphdatenbank&lt;br /&gt;
* [https://www.timescale.com/docs TimescaleDB Documentation] – Zeitreihendatenbank&lt;br /&gt;
* [https://docs.influxdata.com/ InfluxDB Documentation] – Zeitreihendatenbank&lt;br /&gt;
* [https://www.postgresql.org/docs/ PostgreSQL Documentation] – Relationale Datenbank&lt;br /&gt;
* [https://www.mongodb.com/docs/ MongoDB Documentation] – Dokumentendatenbank&lt;br /&gt;
* [https://airflow.apache.org/docs/ Apache Airflow Documentation] – Workflow-Orchestrierung&lt;br /&gt;
* [https://kafka.apache.org/documentation/ Apache Kafka Documentation] – Streaming-Plattform&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;cloud-datenbanken&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== Cloud-Datenbanken ===&lt;br /&gt;
&lt;br /&gt;
* [https://aws.amazon.com/products/databases/ AWS Database Services] – Managed Database Services&lt;br /&gt;
* [https://cloud.google.com/products/databases Google Cloud Databases] – Cloud-Datenbanken&lt;br /&gt;
* [https://azure.microsoft.com/en-us/products/category/databases/ Azure Database Services] – Microsoft Cloud-Datenbanken&lt;br /&gt;
* [https://supabase.com/ Supabase] – Open-Source Firebase Alternative&lt;br /&gt;
* [https://planetscale.com/ Planetscale] – Serverless MySQL&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;big-data-frameworks&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== Big Data Frameworks ===&lt;br /&gt;
&lt;br /&gt;
* [https://spark.apache.org/docs/latest/ Apache Spark Documentation] – Verteilte Datenverarbeitung&lt;br /&gt;
* [https://hadoop.apache.org/docs/ Apache Hadoop Documentation] – Big Data Framework&lt;br /&gt;
* [https://kafka.apache.org/documentation/ Apache Kafka Documentation] – Streaming-Plattform&lt;br /&gt;
* [https://clickhouse.com/docs/ ClickHouse Documentation] – OLAP-Datenbank&lt;br /&gt;
* [https://iceberg.apache.org/docs/ Apache Iceberg] – Table Format für Data Lakes&lt;br /&gt;
&lt;br /&gt;
&amp;lt;span id=&amp;quot;communities--blogs&amp;quot;&amp;gt;&amp;lt;/span&amp;gt;&lt;br /&gt;
=== Communities &amp;amp;amp; Blogs ===&lt;br /&gt;
&lt;br /&gt;
* [https://www.reddit.com/r/database/ r/Database] – Datenbank-Diskussionen&lt;br /&gt;
* [https://www.reddit.com/r/bigdata/ r/bigdata] – Big Data Themen&lt;br /&gt;
* [https://www.reddit.com/r/vectordb/ r/vectordb] – Vektordatenbanken&lt;br /&gt;
* [https://www.reddit.com/r/dataengineering/ r/dataengineering] – Datenengineering&lt;br /&gt;
* [https://roundup.getdbt.com/ The Analytics Engineering Roundup] – Daten-Newsletter&lt;br /&gt;
* [https://www.datacouncil.ai/ Data Council] – Daten-Community&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
-----&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;Letzte Aktualisierung: Juli 2026&amp;#039;&amp;#039;&lt;br /&gt;
&lt;/div&gt;</summary>
		<author><name>imported&gt;Thorsten Klöhn</name></author>
	</entry>
</feed>