Content-Verification-Service jetzt verfügbar! Buchen Sie Ihre 30-minütige Demo hier.

Datenplattform: Die Datensätze bauen, auf denen Ihre KI und Ihr Crowd laufen

18. Juli 2026·
Alea Annacker
Datenplattform: Die Datensätze bauen, auf denen Ihre KI und Ihr Crowd laufenKI-generiert

Was die Datenplattform ist

Die Datenplattform ist das Modul von Crowdee, in dem Sie große multimodale Datensätze erstellen, bereinigen, erweitern und verwalten. Sie ist die eine Stelle, an der Sie Dateien hochladen, sie durch den Cleaning- und Language-Tech-Pipeline-Katalog laufen lassen, Duplikate entfernen und das Ergebnis versionieren — sodass der bereinigte Datensatz, der heute läuft, jederzeit reproduzierbar ist, aus genau den Inputs, mit denen Sie angefangen haben.

Die Datenplattform sitzt zwischen der Crowd Platform, in der Worker Labels erzeugen, und der AI Platform, in der ein Datensatz zu Trainingsdaten für ein finetuniertes Modell wird. Sie ist die Schicht, die rohe Dateien — Ihre eigenen Archive, einen Content-Gathering-Output, einen Drittanbieter-Dump — in ein strukturiertes Asset verwandelt, das nachgelagerte Pipelines konsumieren können. Jede nachgelagerte Oberfläche auf Crowdee, die einen echten Datensatz braucht, liest aus der Datenplattform, nicht aus einem einmaligen Datei-Upload.

Das unterscheidet sie von den Verifikations-Produkten. Verifikation ist ein geliefertes Ergebnis: Sie liefern ein Stück Content, wir liefern ein Urteil zurück. Die Datenplattform ist das dauerhafte Substrat, das wiederkehrende Verifikation, wiederkehrendes Labeling und wiederkehrendes Modell-Training überhaupt erst möglich macht. Wenn Sie „Ich habe einen Stapel Dateien und will sie sauber, dedupliziert, versioniert und bereit, in einen Job einzuspeisen, der jede Woche läuft" brauchen, ist die Datenplattform die Oberfläche, die dafür gebaut wurde.

Datensätze und Versionen

Ein Datensatz ist eine benannte, versionierte Sammlung von Items. Sie erstellen einen Datensatz, laden einen ersten Batch Dateien hoch — Bild, Audio, Video, Text oder Dokument — und die Plattform speichert sie. Jeder Upload, jeder Cleaning-Run, jeder Pipeline-Output erzeugt eine neue Version des Datensatzes. Versionen sind append-only: Sie verlieren nie einen früheren Zustand, auch wenn der nächste Run ihn überholt.

Jedes Item trägt einen unveränderlichen Hash und eine Vorgänger-Version-Referenz. Wenn Sie dieselbe Datei zweimal hochladen (oder sie in einem späteren Batch erscheint), erkennt die Plattform das. Wenn ein Cleaning-Run eine abgeleitete Version neu berechnet, verlinkt die neue Version trotzdem zurück auf die Inputs, die sie produziert haben. Das ist dasselbe Modell, das reproduzierbare ML-Pipelines in Forschung und Produktion trägt: Sie können jederzeit die Frage „Was enthielt dieser Datensatz vor drei Monaten, und was lief damals darauf?" beantworten, indem Sie den Versions-Graphen durchlaufen.

Versionen sind die Konsum-Einheit. Wenn die Crowd Platform einen Job laufen lässt, zeigt sie auf eine bestimmte Version eines Input-Datensatzes. Wenn die AI Platform Trainingsdaten zieht, zeigt sie auf eine bestimmte Version. Wenn Sie eine Verifikations-Pipeline gegen die Daten des letzten Quartals erneut laufen lassen, zeigen Sie auf die Version des letzten Quartals. Die Versions-Referenz ist das, was die ganze Plattform Ende-zu-Ende auditierbar macht.

Cleaning- und Language-Tech-Pipelines

Jede Datei in einem Datensatz kann durch den Pipeline-Katalog verarbeitet werden. Der Katalog ist in zwei Familien organisiert. Cleaning-Pipelines erledigen Daten-Hygiene: Stille-Trimming bei Audio, PII-Redaktion bei Text, Format-Konvertierung zwischen Dokumentformaten und ähnliche Transformationen, die aus einem rohen Upload eine nutzbare Datei machen. Language-Tech-Pipelines extrahieren: Whisper-basierte Transkription von Audio, Vision-Model-OCR von gescannten Dokumenten, Sprach-Identifikation, Named-Entity-Detection und LLM-basierte Übersetzung.

Ein Pipeline-Run nimmt eine Datensatz-Version und produziert eine neue Datensatz-Version. Audio-Trimming produziert eine Version mit kürzerer Dauer und demselben Item-Count. Audio-Transkription produziert eine Version, in der jedes Item jetzt eine Transkript-Spalte hat. Text-Übersetzung produziert eine Version, in der der Quelltext mit einer Ziel-Sprachen-Version gepaart ist. Jeder Output ist selbst ein echter, abfragbarer Datensatz, nicht eine Seiten-Datei am Original.

Pipelines können verkettet werden. Ein Run, der Audio eines Podcasts trimmt, transkribiert, die Sprache identifiziert und Entity-Erwähnungen extrahiert, ist eine ganz normale Pipeline-Komposition, kein Sonderfall. Der Katalog stellt die Bausteine bereit; die Per-Projekt-Run-Konfiguration wählt die Reihenfolge. Das ist operativ dieselbe Primitive wie eine ETL-Pipeline, aber die Storage-Schicht ist der versionierte Datensatz der Datenplattform, nicht ein generischer Blob-Store.

Deduplizierung und Review

Zwei Items in einem Datensatz, die gleich aussehen, sollten nicht doppelt bezahlt werden. Die Datenplattform hasht jedes Item beim Upload und bei jedem Pipeline-Output und zeigt Near-Duplikate und exakte Duplikate als Review-Queue. Sie können automatische Deduplizierung konfigurieren (Items, deren Hash mit einem existierenden übereinstimmt, werden verworfen) oder menschlich überprüfte Deduplizierung (sie werden in eine Reviewer-Queue hochgestuft, die den Operator entscheiden lässt).

Die Review-Queue ist dasselbe Dashboard-Primitiv, das Sie auch anderswo auf Crowdee nutzen: Sie zeigt Pending-Items, der Operator akzeptiert oder lehnt ab, und das Ergebnis wird persistiert. Ein wöchentliches Review der Pending-Duplikate hat dieselbe Form wie ein wöchentliches Review der Pending-Crowd-Antworten. Warum das wichtig ist: Deduplizierung ist der größte Hebel zur Kosten-Kontrolle in einem Labeling-Programm, und die Operator-UI sollte sie so einfach machen wie das Akzeptieren einer Crowd-Antwort.

Qualitäts-Flags werden neben Duplikaten gezeigt. Items, die in einem Pipeline-Run fehlgeschlagen sind, Items unter einer konfigurierten Längen- oder Dauer-Schwelle, Items, deren MIME-Typ nicht zum erwarteten passt — all das erscheint in der Review-Queue auf dieselbe Weise. Der Operator entscheidet, was bleibt; die Plattform führt einen Audit-Trail über jede Entscheidung.

Wohin der fertige Datensatz geht

Ein fertiger Datensatz wird von jeder nachgelagerten Oberfläche auf Crowdee konsumiert. Ein versionierter Datensatz ist die Input-Daten für einen Crowd-Platform-Job — das Worker-Panel wird mit den Items der Version gefüttert, auf die Sie zeigen, und die Antworten werden bei Abschluss in eine neue Version zurückgestrickt. Ein versionierter Datensatz ist die Trainingsdaten für einen AI-Platform-Finetune-Run — dieselben Hashes, dieselbe Versions-Referenz, derselbe Audit-Trail. Ein versionierter Datensatz ist die Datei-Quelle für einen Verifikations-Pipeline-Run — derselbe Inhalt, dieselbe Provenienz, derselbe reproduzierbare Re-Run, wenn die Frage zurückkommt.

Die Datenplattform ist die Antwort auf „Wo leben meine Dateien, und woher weiß ich, was mit ihnen gemacht wurde." Files rein, bereinigt, dedupliziert, versioniert, erneut versioniert, und jetzt konsumierbar vom Rest von Crowdee. Dieselben Plattformen, die die Verifikations-Arbeit und die Finetuning-Arbeit erledigen, ziehen ihre Inputs von hier, sodass der Datensatz, den Sie diesen Monat kuratieren, der Datensatz ist, auf dem Sie nächstes Quartal erneut laufen können — und der Audit-Trail folgt ihm.

Um zu sehen, wie ein fertiger Datensatz von der Operator-Seite aussieht, werfen Sie einen Blick auf die Datenplattform-Übersicht. Um zu besprechen, wie der Datensatz in Ihre Pipeline passt, buchen Sie einen Demo-Call — wir gehen mit Ihren tatsächlichen Daten und den Pipelines, die Sie darauf laufen würden, durch.