Generative AI & LLMs intermediate

Synthetic Data

Training or test data generated by a model rather than collected from the real world.

Synthetische Daten füllen Lücken, wo echte Daten knapp, sensibel oder teuer sind — seltene Randfälle, datenschutzrechtlich gesperrte Datensätze, ausgewogene Beispiele einer Minderheitsklasse. Das Risiko schaukelt sich auf: Ein Modell, das auf der eigenen Art von Ausgaben trainiert wird, kann sich von der Realität entfernen und vorhandene Verzerrungen verstärken, statt sie zu korrigieren.

In der Praxis: 5,000 plausible Support-Tickets erzeugen, um ein Szenario abzudecken, von dem du drei echte Beispiele hast.

Where this comes up