OPEN SOURCE DATA PLATFORM

Apache Data Ecosystem:
verinin kaynaktan analitiğe yolculuğu.

Modern veri platformları tek bir araçtan oluşmaz. Entegrasyon, orkestrasyon, batch/stream processing, lakehouse, analitik SQL, dağıtık depolama ve arama katmanlarını doğru ürünlerle bir araya getirerek ölçeklenebilir bir veri mimarisi oluşturabilirsiniz.

TEKNOLOJİ DEĞİL, MİMARİ

Her Apache projesinin veri zincirinde
farklı bir görevi vardır.

Doğru çözüm, mümkün olduğunca çok Apache ürünü kurmak değildir. Veri hacmi, gecikme beklentisi, kullanıcı profili, ekip yetkinliği, cloud/on-prem gereksinimi ve işletim maliyeti birlikte değerlendirilerek doğru katmanlar seçilmelidir.

01Integration & Streaming

NiFi · Hop · Kafka · Flume · Legacy Sqoop

02Orchestration

Apache Airflow

03Processing

Spark · Flink · Storm · Pig

04Lakehouse

Apache Iceberg · Delta Lake · Apache Hudi

05SQL & Analytics

Hive · Impala · Drill · Doris

06Operational Data

HBase · Cassandra · Kudu · CouchDB · Ignite

07Search

Apache Lucene · Apache Solr

08BI Consumption

Apache Superset

HANGİ TEKNOLOJİ, HANGİ İHTİYAÇ?

Teknolojiyi adıyla değil,
çözdüğü problemle değerlendirin.

Her kartta ürünün temel rolünü, hangi ihtiyacı karşıladığını ve sahada nerede kullanıldığını görebilirsiniz. Aynı mimaride yalnızca gerçekten ihtiyaç duyulan bileşenleri seçmek esastır.

Apache NiFi logosu NI
Integration & Ingestion

Apache NiFi

Temel ihtiyaç
Dataflow / veri entegrasyonu
Ne için kullanılır?
API, dosya, veritabanı ve mesaj sistemlerinden gelen veriyi görsel akışlarla toplamak, yönlendirmek, filtrelemek ve dönüştürmek.
Saha örneği
Fabrika cihazlarından ve ERP API’lerinden gelen veriyi doğrulayıp Kafka’ya ve data lake’e akıtmak.
Apache Hop logosu HO
Integration & Ingestion

Apache Hop

Temel ihtiyaç
ETL / veri entegrasyonu
Ne için kullanılır?
Görsel pipeline ve workflow’larla veri taşıma, dönüştürme, kalite kontrolü ve ETL/ELT süreçleri geliştirmek.
Saha örneği
ERP’den satış ve stok verilerini alıp gece çalışan pipeline ile veri ambarına yüklemek.
Apache Kafka logosu KA
Integration & Ingestion

Apache Kafka

Temel ihtiyaç
Event streaming / mesajlaşma
Ne için kullanılır?
Sistemler arasında yüksek hacimli, dayanıklı ve gerçek zamanlı event akışı oluşturmak; üretici ve tüketicileri birbirinden ayırmak.
Saha örneği
E-ticaret sipariş, ödeme ve clickstream event’lerini anlık analitik sisteme taşımak.
Apache Flume logosu FL
Integration & Ingestion

Apache Flume

Temel ihtiyaç
Log / event toplama
Ne için kullanılır?
Özellikle yüksek hacimli log ve event verilerini güvenilir şekilde Hadoop/HDFS gibi hedeflere taşımak.
Saha örneği
Yüzlerce web sunucusunun access loglarını merkezi HDFS ortamına aktarmak.
Apache Sqoop logosu SQ
Integration & Ingestion

Apache Sqoop

Temel ihtiyaç
Legacy RDBMS ↔ Hadoop aktarımı
Ne için kullanılır?
İlişkisel veritabanları ile Hadoop arasında toplu veri aktarımı için kullanılmıştır; proje Apache Attic’tedir ve yeni projelerde önerilmez.
Saha örneği
Eski Hadoop ortamındaki Oracle→HDFS Sqoop job’larını NiFi/Hop/Spark tabanlı modern akışlara dönüştürmek.
Apache Airflow logosu AI
Orchestration

Apache Airflow

Temel ihtiyaç
Workflow orchestration
Ne için kullanılır?
ETL, veri mühendisliği ve analitik iş akışlarını DAG mantığıyla zamanlamak, bağımlılıklarını yönetmek, izlemek ve yeniden çalıştırmak.
Saha örneği
Gecelik ERP yüklemesi → Spark dönüşümü → kalite kontrolü → BI refresh zincirini tek DAG ile yönetmek.
Apache Spark logosu SP
Processing

Apache Spark

Temel ihtiyaç
Dağıtık batch / SQL processing
Ne için kullanılır?
Büyük veri üzerinde ETL, batch processing, dağıtık SQL ve streaming iş yüklerini ölçekli biçimde çalıştırmak.
Saha örneği
Milyarlarca satış hareketinden günlük müşteri segmentleri ve özet analitik tablolar üretmek.
Apache Storm logosu ST
Processing

Apache Storm

Temel ihtiyaç
Gerçek zamanlı stream processing
Ne için kullanılır?
Sürekli gelen event’leri düşük gecikmeyle topology tabanlı olarak işlemek ve sonuçları downstream sistemlere iletmek.
Saha örneği
Telekom event akışında anlık sayaç, alarm ve kullanım metrikleri hesaplamak.
Apache Pig logosu PI
Processing

Apache Pig

Temel ihtiyaç
Büyük veri dönüşümü / ETL
Ne için kullanılır?
Pig Latin ile Hadoop verileri üzerinde filter, join, group ve aggregate gibi dönüşümleri yüksek seviyeli ifadelerle gerçekleştirmek.
Saha örneği
Mevcut Hadoop ortamındaki uzun MapReduce dönüşümlerini daha okunabilir Pig Latin script’leriyle yönetmek.
Apache Iceberg logosu IC
Lakehouse

Apache Iceberg

Temel ihtiyaç
Açık lakehouse table format
Ne için kullanılır?
Data lake üzerinde ACID işlemleri, schema evolution, partition evolution, snapshot ve time travel özellikleriyle güvenilir analitik tablolar yönetmek.
Saha örneği
Yıllar içinde kolonları ve partition yapısı değişen satış tablosunu Spark, Flink ve BI motorlarının ortak kullanmasını sağlamak.
Delta Lake logosu DL
Lakehouse

Delta Lake

Temel ihtiyaç
Transactional lakehouse
Ne için kullanılır?
Data lake üzerinde ACID transactions, schema enforcement/evolution, time travel ve MERGE/UPDATE/DELETE operasyonları sağlamak.
Saha örneği
CRM’den gelen müşteri değişikliklerini lakehouse tablosuna SCD/CDC mantığıyla MERGE etmek.
Apache Hudi logosu HU
Lakehouse

Apache Hudi

Temel ihtiyaç
Incremental lakehouse / CDC
Ne için kullanılır?
Upsert, delete, indexing, incremental query ve change-stream odaklı sürekli değişen veri kümelerini yönetmek.
Saha örneği
ERP sipariş değişikliklerini yalnızca değişen kayıtları işleyerek data lake’e incremental biçimde aktarmak.
Apache Hive logosu HI
SQL & Analytics

Apache Hive

Temel ihtiyaç
Data warehouse / SQL
Ne için kullanılır?
Hadoop ve data lake üzerindeki büyük veri kümelerini SQL benzeri sorgularla modellemek ve analiz etmek.
Saha örneği
Object storage üzerindeki yıllık işlem geçmişini departmanların SQL ile analiz edebileceği tablolar olarak sunmak.
Apache Impala logosu IM
SQL & Analytics

Apache Impala

Temel ihtiyaç
Düşük gecikmeli analitik SQL
Ne için kullanılır?
Hadoop tabanlı büyük veri üzerinde interaktif ve düşük gecikmeli SQL sorguları çalıştırmak.
Saha örneği
Milyarlarca satış satırını yönetim dashboard’unda saniyeler içinde filtreleyip sorgulamak.
Apache Drill logosu DR
SQL & Analytics

Apache Drill

Temel ihtiyaç
Schema-on-read dağıtık SQL
Ne için kullanılır?
Parquet, JSON, Hadoop ve farklı veri kaynaklarını önceden klasik şema tanımlamadan SQL ile keşfetmek ve sorgulamak.
Saha örneği
Data lake’e yeni düşen yarı yapılandırılmış JSON dosyalarını ETL geliştirmeden hızlıca analiz etmek.
Apache Doris logosu DO
SQL & Analytics

Apache Doris

Temel ihtiyaç
Real-Time OLAP / analitik veritabanı
Ne için kullanılır?
Yüksek concurrency altında düşük gecikmeli SQL sorguları, real-time dashboard, ad-hoc analysis ve analitik serving ihtiyaçlarını karşılamak.
Saha örneği
E-ticaret operasyon merkezinde saniyelik sipariş, ödeme, teslimat ve hata KPI’larını yoğun kullanıcı trafiğinde hızlı sunmak.
Apache HBase logosu HB
Operational Data

Apache HBase

Temel ihtiyaç
Dağıtık NoSQL / düşük gecikme
Ne için kullanılır?
Çok büyük ve seyrek tablolarda key tabanlı düşük gecikmeli read/write erişimi sağlamak.
Saha örneği
Telekom müşterisinin son kullanım hareketlerine müşteri ID üzerinden çok hızlı erişmek.
Apache Cassandra logosu CA
Operational Data

Apache Cassandra

Temel ihtiyaç
Dağıtık operational database
Ne için kullanılır?
Çok yüksek yazma hacmi, yatay ölçeklenebilirlik ve yüksek erişilebilirlik gereken distributed uygulama verilerini saklamak.
Saha örneği
Milyonlarca IoT cihazından sürekli gelen sensör ölçümlerini kesintiye dayanıklı biçimde saklamak.
Apache Kudu logosu KU
Operational Data

Apache Kudu

Temel ihtiyaç
Hızlı analitik veri depolama
Ne için kullanılır?
Hem hızlı insert/update hem de analitik SQL erişimi gereken mutable structured data için kolon bazlı depolama sağlamak.
Saha örneği
Üretim hattındaki güncel makine durumlarını hızlı yazıp aynı veriyi Impala üzerinden interaktif analiz etmek.
Apache CouchDB logosu CO
Operational Data

Apache CouchDB

Temel ihtiyaç
Document database
Ne için kullanılır?
JSON dokümanlarını esnek şema, HTTP/REST yaklaşımı ve replikasyon özellikleriyle saklamak.
Saha örneği
Saha uygulamasında çevrimdışı oluşturulan form ve gözlem kayıtlarını JSON olarak saklayıp daha sonra senkronize etmek.
Apache Ignite logosu IG
Operational Data

Apache Ignite

Temel ihtiyaç
In-memory computing / cache
Ne için kullanılır?
Dağıtık RAM tabanlı cache, düşük gecikmeli data access ve compute ihtiyaçlarını karşılamak.
Saha örneği
Sık kullanılan müşteri fiyatlandırma ve kural verilerini bellekte tutarak uygulama yanıt sürelerini düşürmek.
Apache Lucene logosu LU
Search

Apache Lucene

Temel ihtiyaç
Arama motoru kütüphanesi
Ne için kullanılır?
Uygulamaların içine full-text search, indexing, scoring ve metin arama yetenekleri eklemek için temel search engine kütüphanesi sağlamak.
Saha örneği
Doküman yönetim sisteminde milyonlarca sözleşme ve rapor içinde içerik bazlı arama geliştirmek.
Apache Solr logosu SO
Search

Apache Solr

Temel ihtiyaç
Kurumsal arama platformu
Ne için kullanılır?
Lucene tabanlı full-text search, faceting, distributed indexing, replication ve search API yeteneklerini hazır servis olarak sunmak.
Saha örneği
E-ticaret sitesinde ürün adı, kategori, marka, özellik ve facet filtreleriyle hızlı ürün araması sunmak.
Apache Superset logosu SU
BI Consumption

Apache Superset

Temel ihtiyaç
BI / visualization
Ne için kullanılır?
SQL tabanlı veri kaynaklarından dashboard, veri keşfi, semantic metrics ve embedded analytics deneyimleri oluşturmak.
Saha örneği
Satış, kârlılık ve operasyon KPI’larını yöneticilere web tabanlı interaktif dashboard olarak sunmak.
Iceberg vs Delta Lake vs Apache Hudi

Iceberg multi-engine birlikte çalışabilirliği, açık table-format yaklaşımı ve schema/partition evolution ile; Delta Lake ACID, MERGE ve Spark merkezli transactional lakehouse kullanımında; Apache Hudi ise CDC, upsert ve incremental pipeline senaryolarında öne çıkar. Seçim mevcut engine’ler, update yoğunluğu ve platform bağımsızlığı beklentisine göre yapılmalıdır.

ÖRNEK MODERN DATA STACK

Ürünleri değil,
veri akışını tasarlıyoruz.

Bir mimaride tüm bileşenlerin Apache olması gerekmez. Örneğin kaynak sistemlerden NiFi/Hop ile veri alınabilir, Airflow ile iş akışları yönetilebilir, Spark/Flink ile veri işlenebilir, Iceberg, Delta Lake veya Hudi üzerinde lakehouse tabloları oluşturulabilir, Doris/Impala ile sorgulanabilir ve Superset ile kullanıcıya sunulabilir.

KaynaklarERP · CRM · API · IoT
→
IngestionNiFi · Hop · Kafka
→
OrchestrationAirflow
→
ProcessingSpark · Flink · Storm · Pig
→
LakehouseIceberg · Delta · Hudi
→
ServingDoris · Impala · Drill
→
AnalyticsSuperset · Qlik
OPEN TABLE FORMAT / LAKEHOUSE

Iceberg, Delta Lake ve Hudi:
hangisi ne zaman öne çıkar?

Bu üç teknoloji aynı probleme farklı önceliklerle yaklaşır. Seçimde yalnızca popülerlik değil; compute engine çeşitliliği, CDC/upsert yoğunluğu, streaming modeli, platform bağımlılığı ve operasyon ekibinin yetkinliği dikkate alınmalıdır.

01Apache Iceberg

Multi-engine lakehouse, açık table format, hidden partitioning ve güçlü schema/partition evolution.

02Delta Lake

ACID, MERGE/UPDATE/DELETE, schema enforcement ve batch-stream birleşimi; özellikle Spark merkezli mimarilerde güçlü.

03Apache Hudi

CDC, upsert/delete, indexing ve incremental processing; sürekli değişen verinin lake'e taşınmasında güçlü.

Tek bir “en iyi” format yoktur.

BI ağırlıklı çoklu motor erişiminde Iceberg; Spark merkezli transactional lakehouse yaklaşımında Delta Lake; yoğun CDC/upsert ve incremental pipeline senaryolarında Hudi öne çıkabilir. Kurumsal seçim, gerçek workload üzerinde proof of concept ile doğrulanmalıdır.

DANIŞMANLIK YAKLAŞIMI

Hangi Apache ürününü seçmelisiniz?

Bu soruya ürün isimleriyle başlamak çoğu zaman yanlış mimariye götürür. Önce veri akışının SLA'sı, batch/stream gereksinimi, veri büyüklüğü, sorgu concurrency'si, recovery beklentisi, ekip yetkinlikleri ve mevcut altyapı belirlenmelidir.

Önce iş yükünü sınıflandırıyoruz

Gerçek zamanlı event processing mi, günlük batch ETL mi, interaktif SQL mi, geniş ölçekli key-value erişimi mi, full-text search mü? Her gereksinimin doğru teknoloji sınıfı farklıdır.

Sonra birlikte çalışabilirliği değerlendiriyoruz

Apache ekosisteminin en önemli avantajlarından biri farklı projelerin açık standartlar ve connector'lar üzerinden birlikte çalışabilmesidir. Iceberg'in Spark ve Flink gibi motorlarla; Airflow'un çok sayıda Apache provider ile; Doris'in Flink/Spark ve BI araçlarıyla entegrasyonu buna örnektir. Lakehouse katmanında ise yalnızca Apache projelerini değil, Delta Lake gibi Apache dışındaki açık teknolojileri de tarafsız biçimde değerlendiriyoruz.

Operasyon maliyetini tasarıma dahil ediyoruz

Açık kaynak lisans maliyetini azaltabilir; ancak cluster yönetimi, güvenlik, monitoring, upgrade, backup ve yetkin insan kaynağı maliyeti devam eder. Bu nedenle mimari yalnızca teknik kabiliyete göre değil, toplam sahip olma maliyetine göre de değerlendirilmelidir.

Teknoloji bağımsız yaklaşım

Apache ürünlerini yalnızca açık kaynak oldukları için önermiyoruz. Kurumunuzun mevcut Microsoft, Qlik, cloud veya SQL yatırımlarını koruyarak açık kaynak bileşenlerin gerçekten değer yarattığı katmanlarda hibrit mimariler tasarlıyoruz.

Apache Data Ecosystem hakkında sık sorulanlar

Apache Data Ecosystem nedir?

Apache Data Ecosystem tek bir ürün değil; veri entegrasyonu, orkestrasyon, batch ve stream processing, lakehouse tablo formatları, analitik SQL, dağıtık veri depolama ve arama gibi farklı ihtiyaçları karşılayan açık kaynak Apache projelerinin birlikte kullanılabildiği geniş bir teknoloji ekosistemidir.

Bu Apache ürünlerinin hepsini aynı projede kullanmak gerekir mi?

Hayır. Doğru yaklaşım teknoloji sayısını artırmak değil, ihtiyaca göre en az sayıda doğru bileşeni seçmektir. Örneğin Airflow orkestrasyon, Spark batch processing ve Iceberg lakehouse tabloları için birlikte kullanılabilirken başka bir senaryoda Flink, Doris ve Superset daha uygun olabilir.

Apache Spark ile Apache Flink arasındaki temel fark nedir?

Her ikisi de dağıtık veri işleme platformudur. Spark batch, SQL, data science ve streaming iş yüklerini tek ekosistemde birleştirirken; Flink özellikle stateful stream processing, event-time ve düşük gecikmeli sürekli veri akışlarında güçlüdür. Seçim iş yükü ve operasyon modeline göre yapılmalıdır.

Apache Iceberg bir veritabanı mıdır?

Hayır. Iceberg büyük analitik veri kümeleri için açık bir table formatıdır. Spark, Flink, Hive ve Impala gibi motorların aynı veri dosyalarını güvenli ve tutarlı tablolar olarak kullanmasına yardımcı olur.

Iceberg, Delta Lake ve Apache Hudi arasındaki fark nedir?

Üçü de data lake üzerinde güvenilir tablo yönetimi sağlar; ancak odakları farklıdır. Iceberg çoklu engine birlikte çalışabilirliği ve açık table-format yaklaşımıyla, Delta Lake güçlü ACID işlemleri ve batch-stream birleşimiyle, Apache Hudi ise upsert, CDC ve incremental processing odaklı iş yükleriyle öne çıkar. Seçim veri işleme motoru, update yoğunluğu ve platform bağımsızlığı beklentisine göre yapılmalıdır.

Apache Sqoop yeni projelerde öneriliyor mu?

Apache Sqoop 2021 yılında emekliye ayrılarak Apache Attic’e taşınmıştır. Bu nedenle yeni mimarilerde aktif bir teknoloji tercihi olarak önermiyoruz; mevcut legacy Hadoop sistemlerini değerlendirirken ve modernizasyon planı oluştururken ele alıyoruz.

Apache Pig bugün hâlâ kullanılıyor mu?

Evet. Apache Pig aktif bir Apache projesidir ve 0.18.0 sürümü Eylül 2025’te yayımlanmıştır. Bununla birlikte yeni greenfield veri platformlarında Spark SQL, Hive veya modern ELT yaklaşımları daha sık tercih edildiği için Pig özellikle mevcut Hadoop/Pig Latin iş yüklerinin bakımı ve modernizasyonunda önem taşır.

Apache Superset bu ekosistemin neresinde yer alır?

Superset veri işleme veya veri ambarı değildir; işlenmiş ve sorgulanabilir verinin kullanıcıya dashboard ve veri keşfi katmanı olarak sunulduğu analitik tüketim katmanında konumlanır. Spark SQL, Doris, Impala ve desteklenen diğer SQL veri kaynaklarıyla birlikte kullanılabilir.

DATA PLATFORM MODERNİZASYONU

Mevcut veri mimarinizi birlikte değerlendirelim.

Hadoop tabanlı legacy sistemlerden modern lakehouse mimarisine, batch ETL'den gerçek zamanlı streaming'e veya kapalı ürünlerden açık kaynak bileşenlere geçiş için uygulanabilir bir yol haritası oluşturalım.

Projenizi Konuşalım →