Deduplizierung ist ein Verfahren in der Datenverwaltung, bei dem redundante Datenkopien eliminiert werden, um den Speicherbedarf zu reduzieren. Bei der Deduplizierung werden mehrere Kopien derselben Daten nur einmal gespeichert. Wenn diese Daten erneut benötigt werden, wird auf die bereits gespeicherte Kopie verwiesen, anstatt eine neue Kopie zu erstellen.

Deduplizierung wird häufig in Speichersystemen und in der Datensicherung eingesetzt, um die Menge der zu speichernden Daten zu verringern und die Effizienz zu erhöhen.




Deduplizierung – doppelte Daten nur einmal speichern

Deduplizierung Prinzip Ohne Deduplizierung werden gleiche Datenblöcke mehrfach gespeichert, mit Deduplizierung nur einmal mit Verweisen Ohne Deduplizierung Datei A: Block 1 Block 2 Block 3 Datei B: Block 1 Block 4 Block 3 Datei C: Block 2 Block 3 Block 4 9 Blöcke gespeichert – viele Duplikate! Mit Deduplizierung Einmaliger Speicher: Block 1 Block 2 Block 3 Block 4 Verweise (Pointer): Datei A → 1, 2, 3 Datei B → 1, 4, 3 Datei C → 2, 3, 4 Nur 4 Blöcke statt 9 – 55 % gespart! Auswirkungen auf Performance + Speichereffizienz Bis zu 90 % weniger Speicher bei Backups / VMs − CPU-Last Hash-Berechnung kostet Rechenzeit Inline vs. Post-Process beim Schreiben oder nachträglich

Wie funktioniert Deduplizierung?

Das System berechnet für jeden Datenblock einen Hashwert (eine Art Fingerabdruck). Existiert ein Block mit diesem Hash bereits, wird er nicht erneut gespeichert – stattdessen wird nur ein Verweis (Pointer) auf den vorhandenen Block angelegt.

Auswirkung auf Speichereffizienz:

Bei Backups, virtuellen Maschinen oder Dokumenten mit ähnlichem Inhalt kann die Deduplizierung den Speicherbedarf drastisch reduzieren – typisch 50–90 % Einsparung. Besonders wirksam, wenn viele ähnliche Dateien existieren (z. B. 100 VMs mit gleichem Betriebssystem).

Auswirkung auf Performance:

Das Berechnen der Hashwerte kostet CPU-Zeit und erhöht die Latenz beim Schreiben. Es gibt zwei Varianten: Inline-Deduplizierung (direkt beim Schreiben, höhere Last, sofortige Einsparung) und Post-Process-Deduplizierung (nachträglich im Hintergrund, geringere Schreib-Last, aber Speicher erst später freigegeben).

        **Deduplizierung – doppelte Daten nur einmal speichern****Wie funktioniert Deduplizierung?**



| Aspekt                |             Auswirkung      |
|-----------------------|-----------------------------|
| Speicherplatz         | Stark reduziert (bis 90 %)  |
| Schreib-Performance   | Leicht schlechter (Hash-Berechnung) |
| Lese-Performance      | Kaum beeinträchtigt         |
| Typischer Einsatz     | Backups, VMs, Archivierung  |

**Merksatz:** Deduplizierung = gleiche Daten nur einmal speichern, mehrfach verweisen – wie ein Buch in einer Bibliothek statt in jedem Zimmer.
    

Deduplizierung in der Datenverarbeitung

Definition

Deduplizierung ist ein Verfahren zur Datenoptimierung, bei dem identische Datenblöcke oder Dateien nur einmal gespeichert werden. Statt mehrfacher Kopien werden Verweise (Pointer) auf die ursprünglichen Daten verwendet.

Funktionsweise

Das System erkennt doppelte Daten und speichert sie nur einmal. Weitere identische Daten werden durch Referenzen ersetzt.
Ohne Deduplizierung:
Datei A = 100 MB
Datei B = 100 MB (Kopie)

→ 200 MB Speicherverbrauch

Mit Deduplizierung:
Datei A = 100 MB
Datei B → Verweis auf Datei A

→ 100 MB + Verweis

Arten der Deduplizierung

Einfluss auf Speichereffizienz

Einfluss auf Performance

Vergleich

Merkmal Ohne Deduplizierung Mit Deduplizierung
Speicherverbrauch Hoch Reduziert
Datenredundanz Mehrfach vorhanden Nur einmal gespeichert
Performance Schneller beim Schreiben Langsamer beim Schreiben, effizienter Speicher

Prüfungsantwort (kurz)

Deduplizierung ist ein Verfahren, bei dem identische Daten nur einmal gespeichert werden und weitere Kopien durch Verweise ersetzt werden. Dadurch wird der Speicherbedarf deutlich reduziert. Allerdings kann die Performance beim Schreiben sinken, da die Daten zuerst analysiert und verglichen werden müssen.

Merksatz

Deduplizierung = gleiche Daten nur einmal speichern 🔁💾