Wat is Databricks? Lakehouse-platform Uitgelegd

Bijgewerkt: 25 augustus 2026
Leestijd: 12 minuten
Dataplatformen · Databricks

Databricks is opgericht door de makers van Apache Spark en heeft de "Lakehouse"-architectuur gepopulariseerd: één platform dat de flexibiliteit van een data lake combineert met de betrouwbaarheid van een data warehouse. Deze gids legt uit hoe dat werkt, wat de kerncomponenten zijn, en wanneer Databricks de juiste keuze is.

Databricks in Één Alinea

Databricks is een cloudplatform voor data engineering, analytics en machine learning, gebouwd rond Apache Spark — de open-source verwerkingsengine die de oprichters van Databricks zelf ontwikkelden. Het platform combineert schaalbare, goedkope opslag (zoals een data lake) met transactionele betrouwbaarheid (zoals een data warehouse) in wat Databricks de Lakehouse-architectuur noemt.

In één zin

Waar je vroeger moest kiezen tussen een goedkoop maar onbetrouwbaar data lake of een betrouwbaar maar duur en star data warehouse, belooft de Lakehouse-architectuur beide voordelen tegelijk — via Delta Lake als technische kern.

De Lakehouse-Architectuur Uitgelegd

Een traditioneel data lake slaat alle data goedkoop op in ruwe vorm (Parquet, CSV, JSON) op object storage (S3, Azure Data Lake Storage), maar mist ACID-transacties, schema-afdwinging en efficiënte updates — waardoor data lakes in de praktijk vaak verworden tot "data swamps" vol inconsistente, onbetrouwbare bestanden.

Databricks lost dit op met Delta Lake: een open-source opslaglaag bovenop bestaande object storage die ACID-transacties, schema-afdwinging, en time travel (teruggaan naar een eerdere versie van een tabel) toevoegt aan gewone Parquet-bestanden. Het resultaat: de kostenstructuur en flexibiliteit van een data lake, met de betrouwbaarheid van een warehouse.

Eigenschap Traditioneel Data Lake Traditioneel Data Warehouse Databricks Lakehouse
Opslagkosten Laag Hoog Laag (object storage)
ACID-transacties Nee Ja Ja (via Delta Lake)
Ongestructureerde data Ja Beperkt Ja
ML/AI-workloads Mogelijk, los platform Zelden native Native (MLflow)

Kerncomponenten van Databricks

Delta Lake

De opslaglaag met ACID-transacties en time travel die de Lakehouse-belofte technisch mogelijk maakt. Zie Delta Lake voor een verdieping.

Unity Catalog

Gecentraliseerd governance-laag voor data, modellen en toegangscontrole over werkruimtes en cloudplatformen heen. Zie Unity Catalog Deep Dive.

MLflow

Open-source lifecycle-management voor machine learning: experimenten bijhouden, modellen versiebeheren, en deployen.

Databricks SQL

SQL-interface bovenop de Lakehouse, zodat analisten met standaard SQL kunnen werken zonder Spark-code te schrijven.

Databricks in de Praktijk: een PySpark-Voorbeeld

Een typisch transformatiepatroon in een Databricks-notebook — ruwe transactiedata schoonmaken en aggregeren naar een gold-tabel:

# PySpark: silver naar gold, met Delta Lake als opslagformaat
from pyspark.sql.functions import col, year, sum as spark_sum, avg

# Lees de silver-laag (al opgeschoond, nog niet geaggregeerd)
df = spark.read.format("delta").load("/mnt/silver/transacties")

# Data cleaning: alleen geldige, positieve bedragen
cleaned_df = (
    df
    .filter(col("bedrag") > 0)
    .withColumn("jaar", year(col("datum")))
)

# Aggregatie per jaar en categorie
resultaat = (
    cleaned_df
    .groupBy("jaar", "categorie")
    .agg(
        spark_sum("bedrag").alias("totaal"),
        avg("bedrag").alias("gemiddelde"),
    )
)

# Schrijf naar de gold-laag, klaar voor BI-tools
resultaat.write.format("delta").mode("overwrite").save("/mnt/gold/jaarlijkse_verkopen")

Dit volgt exact het medallion-patroon (bronze/silver/gold): elke laag is een expliciete, herhaalbare transformatiestap, met Delta Lake dat de betrouwbaarheid van elke tussenstap garandeert.

Compute: Clusters, Autoscaling en Photon

Databricks scheidt opslag (Delta Lake op object storage) van rekenkracht (clusters), net als de andere grote cloudplatformen. Een cluster is een groep virtuele machines die samen een Spark-job uitvoeren; clusters kunnen automatisch op- en afschalen op basis van workload, en na een periode van inactiviteit automatisch stoppen om onnodige kosten te voorkomen.

Photon is Databricks' eigen, in C++ geschreven query-engine die de standaard JVM-gebaseerde Spark-uitvoering vervangt voor SQL- en DataFrame-workloads, met aanzienlijke snelheidswinst zonder dat bestaande code hoeft te veranderen. Voor data engineers is het praktische gevolg: clusterkeuzes (grootte, autoscaling-instellingen, wel of niet Photon) zijn een directe kostenknop, vergelijkbaar met warehouse-sizing bij Snowflake.

Job clusters versus all-purpose clusters

Een job cluster wordt automatisch aangemaakt voor een geplande taak en na afloop weer afgebroken — goedkoper en de standaardkeuze voor productiepipelines. Een all-purpose cluster blijft draaien voor interactief notebookgebruik en is duurder per uur, maar nodig tijdens ontwikkeling en exploratie.

Praktische Use Cases

  • Grootschalige ETL-pipelines — Spark's gedistribueerde verwerking schaalt naar terabytes/petabytes aan data.
  • Machine learning end-to-end — van feature engineering tot modeltraining en deployment, allemaal binnen hetzelfde platform via MLflow.
  • Streaming analytics — Spark Structured Streaming voor near-realtime verwerking naast batch-pipelines.
  • Unified governance — Unity Catalog voor lineage tracking en toegangscontrole over teams en werkruimtes heen.
  • BI-integratie — Databricks SQL verbindt rechtstreeks met Power BI en Tableau voor rapportage op de gold-laag.

Wanneer Kies Je Databricks?

Databricks is met name sterk wanneer machine learning en grootschalige, complexe transformaties een centrale rol spelen naast reguliere BI-rapportage — de combinatie van Spark's verwerkingskracht en MLflow's ML-lifecycle in één platform is moeilijk te evenaren. Voor organisaties waar SQL-gebaseerde BI-rapportage de hoofdmoot is en ML een kleinere rol speelt, is Snowflake vaak eenvoudiger; voor Microsoft-shops kan Microsoft Fabric beter aansluiten bij bestaande licenties en tooling. Zie Databricks vs Snowflake vs Microsoft Fabric voor een volledige vergelijking.

Conclusie

Databricks combineert de kostenstructuur en flexibiliteit van een data lake met de betrouwbaarheid van een data warehouse, via Delta Lake als technische kern — aangevuld met Unity Catalog voor governance en MLflow voor machine learning. Het platform is het sterkst wanneer ML en grootschalige transformaties naast elkaar bestaan binnen dezelfde organisatie.

Wil je weten of Databricks past bij jouw dataplatform, of hulp bij het opzetten van een Lakehouse-architectuur? Neem contact op, of duik verder in het gratis Databricks-hoofdstuk van het Data Engineering Handboek.

Veelgestelde vragen

Is Databricks hetzelfde als Apache Spark?

Nee. Databricks is een beheerd cloudplatform gebouwd rond Apache Spark, met extra functionaliteit zoals Delta Lake, Unity Catalog, MLflow en geoptimaliseerde clusters.

Welke cloudplatformen ondersteunt Databricks?

AWS, Microsoft Azure (als Azure Databricks) en Google Cloud Platform, met vrijwel identieke functionaliteit op elk platform.

Wat is het verschil tussen Databricks en een traditioneel data warehouse?

Een traditioneel warehouse is geoptimaliseerd voor gestructureerde data. Databricks is een Lakehouse: de flexibiliteit van een data lake met warehouse-achtige betrouwbaarheid via Delta Lake, in één platform.

Heb je Spark-kennis nodig om met Databricks te werken?

Voor geavanceerde performance-optimalisatie helpt het, maar Databricks SQL laat analisten ook met standaard SQL werken zonder Spark-specifieke code.

Wat is een Data Warehouse? Alle blogs Wat is Data Lineage?