Generative KITrainingsdaten in Form bringen

Guter Input ergibt guten Output – diese einfache Regel gilt auch für die Daten, mit denen KI-Anwendungen trainiert werden.
(Bildquelle: 123rf.com/peshkova)
Anwendungen, die Daten mithilfe Künstlicher Intelligenz (KI) oder maschinellem Lernen (ML) verarbeiten, werden derzeit breit diskutiert. Die Debatte konzentriert sich dabei vor allem auf ethische und sicherheitsrelevante Aspekte und damit auf Fragen des richtigen Einsatzes von (generativer) KI. Die Frage nach der Qualität solcher Anwendungen, die wiederum von den Daten abhängt, mit denen die Algorithmen trainiert werden, wird in der öffentlichen Diskussion vernachlässigt. Zu diesem Schluss kommt das Schweizer Data-Intelligence-Unternehmen Aparavi. Aparavi schätzt, dass bis zu 80 Prozent der Daten, die für das KI-Training infrage kommen, unstrukturiert sind. In diesen Beständen verbergen sich nicht nur veraltete Dokumente oder risikobehaftete Daten, sondern auch wichtige und wertvolle Informationen. Solche Datenbestände müssten schon vorab klassifiziert und bereinigt werden.
Sensible Daten aussieben
Eine saubere Data Collection ist für eine sinnvolle, effektive Entwicklung von KI-Apps essenziell. Denn die Qualität des Outputs bei der KI-Entwicklung hängt zwangsläufig von der Qualität des Inputs ab – je gepflegter die Trainingsdaten, desto höher der Anwendungsnutzen. Ideal sind „transparente, klassifizierte, strukturierte und priorisierte Daten und Metadaten“, so Aparavi, die auch von Dubletten bereinigt sein sollten. Ebenso wichtig sei es, kritische sensible Daten und Dokumente, die aus rechtlichen Gründen nicht verwendet werden dürften, auszusieben. Dazu gehören beispielsweise personenbezogene Daten oder Inhalte, die vor dem Stichtag einer Änderung rechtlich relevanter Vorgaben datieren. Um Verfälschungen, aber auch Risiken und Strafzahlungen zu vermeiden, müssten diese identifiziert und aus Datenbeständen entfernt werden, noch bevor die Datenbestände für das Training generativer KI-Anwendungen herangezogen werden.
Entwicklungszeiten abkürzen
Die Nutzung künstlich erzeugter Datensätze, so genannter synthetischer Daten, nimmt zu. Die Fachleute von Aparavi sehen dies als Indikator der Unzufriedenheit von Data Scientists mit dem vorhandenen echten Datenmaterial. Dennoch seien synthetische Daten kein vollwertiger Ersatz für das Training von KI-Anwendungen: Mit Originaldaten könnten Algorithmen und Anwendungen deutlich schneller und effizienter entwickelt werden als mit simulierten Datensätzen.
KI-Entwicklung ist per se ein iterativer Prozess mit hohem Ressourcenbedarf – und verursacht folglich hohe Kosten. Ein schlechter Dateninput verlängert die Entwicklungszeiten und erhöht die Kosten zusätzlich. Ein sauberer, auf relevante, sinnvolle Daten kondensierter Datenbestand kann die Anwendungsentwicklung hingegen beschleunigen und damit auch den finanziellen Aufwand reduzieren. „Clean and Lean Data spielen bei der Entwicklung von KI- und ML-Apps eine überragende Rolle“, sagt der Aparavi-CEO Adrian Knapp. Ob eine KI-Anwendung erfolgreich wird, entscheide sich an den Daten, die sozusagen das Futter für die zu trainierenden Algorithmen darstellen.
Bayern/cit: Schnell zur Bildungsanerkennung
[13.08.2025] Mit dem Fachkräftemangel steigt der Anteil ausländischer Pflegekräfte im deutschen Gesundheitssystem. Deren Bildungsabschlüsse müssen zunächst formal anerkannt werden. Bayern nutzt eine Low-Code-Lösung, die dieses Verfahren beschleunigt – und wurde nun dafür ausgezeichnet. mehr...
Sachsen-Anhalt: Digitaler Fortschritt für den Acker
[12.08.2025] In Groß Germersleben in Sachsen-Anhalt ging eine neue digitale Wetterstation in Betrieb. Sie ist Teil eines erweiterten Messnetzes, das Landwirten präzisere Daten für Planung, Pflanzenschutz, Bewässerung und Ernte liefert. mehr...
Fraunhofer FOKUS: Einheitliche Lernumgebung für die Bundeswehr
[07.08.2025] Mit der „Virtuellen Lernumgebung der Bundeswehr“ sollen alle Ausbildungseinrichtungen in ein gemeinsames digitales Ökosystem integriert werden. Fraunhofer FOKUS unterstützt das Projekt seit 2022 mit einer Middleware, die Dienste, Datenflüsse und Zugriffsrechte steuert. mehr...
München/Schleswig-Holstein: Gemeinsam für gute Nutzererlebnisse
[31.07.2025] Im Projekt KERN setzen München und Verwaltungscloud.SH künftig gemeinsam Impulse: Sie übernehmen die Federführung für eine neue Technologieanbindung und stärken so die Entwicklung eines länderübergreifenden UX-Standards für die Verwaltung. mehr...
Baden-Württemberg: Rebflächen-Förderung mit FIONA
[29.07.2025] Weinbauern in Baden-Württemberg, die Fördermittel für die Umstrukturierung und Umstellung von Rebflächen beantragen wollen, steht dazu ab sofort ausschließlich der digitale Weg über das Portal FIONA zur Verfügung. mehr...
Bundeswehr/Bitkom: Beschaffung in der digitalen Welt
[28.07.2025] Mit dem Beschluss des Bundeswehr-Planungs- und Beschaffungsbeschleunigungsgesetzes will die Bundesregierung die langwierigen Vergabeverfahren reformieren. Der Digitalverband Bitkom spricht von einem notwendigen Kurswechsel hin zu mehr Digitalisierung und Innovationsfähigkeit in der Verteidigung. mehr...
BMV: Datendienst erleichtert Parkplatzsuche
[24.07.2025] Ein neuer Stellplatzinformationsdienst (SID) soll die Parkplatzsuche für Lkw-Fahrerinnen und -Fahrer in Deutschland künftig deutlich vereinfachen. Das System liefert Echtzeitdaten zur Belegung von Lkw-Stellplätzen auf Autobahn-Rastanlagen – direkt aus dem Mautsystem in die Mobilithek des Bundes. mehr...
Hessen: Ein Jahr Bürokratie-Melder
[21.07.2025] Seit einem Jahr ist in Hessen der erste Bürokratie-Melder Deutschlands online. Entbürokratisierungsminister Manfred Pentz zog eine positive Bilanz: Bürgerinnen und Bürger nutzen den Bürokratie-Melder aktiv und konstruktiv. Viele Meldungen sind in das kürzlich beschlossene Bürokratieabbaugesetz eingeflossen. mehr...
Nordrhein-Westfalen: Pegelnetz wächst weiter
[11.07.2025] Als Reaktion auf die Hochwasserkatastrophe von 2021 erweitert Nordrhein-Westfalen bis Ende 2025 sein Netz an Hochwassermeldepegeln um 45 Prozent. Einer der neuen Standorte ging nun im bergischen Welzen in Betrieb. Insgesamt entstehen 26 neue Messstellen. mehr...
Internationaler Austausch: Digitale Kompetenzen stärken
[11.07.2025] Deutschland will die digitalen Basiskompetenzen seiner Bevölkerung deutlich stärken. Bei einem Austausch mit Österreich – das hier im EU-Vergleich besser dasteht – wurden erfolgreiche Ansätze diskutiert und nächste Schritte angekündigt. mehr...
Dashboard Digitale Verwaltung: Thüringen auf Platz drei
[08.07.2025] Das Dashboard zum bundesweiten Stand der Digitalen Verwaltung zeigt, dass Thüringen in den vergangenen Monaten einen großen Sprung gemacht hat: Bei den digital verfügbaren Verwaltungsleistungen hat der Freistaat zur Spitzengruppe aufgeschlossen. mehr...
Servicestandard: Viel erreicht im Juni
[03.07.2025] Der Servicestandard unterstützt Verwaltungsmitarbeitende und IT-Dienstleister, auf effiziente Weise nutzerfreundliche digitale Services zu entwickeln. Eine neue Website hilft bei der praktischen Umsetzung. Die Mitwirkung von Fachleuten ist beim Ausbau des Servicestandards unentbehrlich. mehr...
Hamburg/Schleswig-Holstein: Designbaukasten für den modernen Staat
[03.07.2025] Gemeinsam mit einer bundesweiten Fach-Community arbeiten Hamburg und Schleswig-Holstein an KERN, einem modularen UX-Standard für digitale Verwaltungslösungen. Nun präsentieren die beiden Länder umfassende Erweiterungen und Verbesserungen. mehr...
Digitale Verwaltung: Luft nach oben
[02.07.2025] Laut einer Umfrage der Firma Iron Mountain sind viele Bürgerinnen und Bürger mit digitalen Verwaltungsdiensten unzufrieden. Gewünscht wird mehr Transparenz, etwa durch Online-Einsicht in Unterlagen. Grundlage dafür ist die strukturierte Digitalisierung von Akten. mehr...
Berlin: Innovationswettbewerb für Verwaltungslösungen
[01.07.2025] Mit der City Challenge ruft Berlin Start-ups, KMU sowie Forschungsinstitute auf, bis zum 27. Juli digitale Lösungen für konkrete Herausforderungen innerhalb der Verwaltung einzureichen. Die besten Vorschläge sollen als Pilotprojekte umgesetzt werden. mehr...