NiFi · Hop · Kafka · Flume · Legacy Sqoop
Apache Data Ecosystem:
verinin kaynaktan analitiğe yolculuğu.
Modern veri platformları tek bir araçtan oluşmaz. Entegrasyon, orkestrasyon, batch/stream processing, lakehouse, analitik SQL, dağıtık depolama ve arama katmanlarını doğru ürünlerle bir araya getirerek ölçeklenebilir bir veri mimarisi oluşturabilirsiniz.
Her Apache projesinin veri zincirinde
farklı bir görevi vardır.
Doğru çözüm, mümkün olduğunca çok Apache ürünü kurmak değildir. Veri hacmi, gecikme beklentisi, kullanıcı profili, ekip yetkinliği, cloud/on-prem gereksinimi ve işletim maliyeti birlikte değerlendirilerek doğru katmanlar seçilmelidir.
Apache Airflow
Spark · Flink · Storm · Pig
Apache Iceberg · Delta Lake · Apache Hudi
Hive · Impala · Drill · Doris
HBase · Cassandra · Kudu · CouchDB · Ignite
Apache Lucene · Apache Solr
Apache Superset
Teknolojiyi adıyla değil,
çözdüğü problemle değerlendirin.
Her kartta ürünün temel rolünü, hangi ihtiyacı karşıladığını ve sahada nerede kullanıldığını görebilirsiniz. Aynı mimaride yalnızca gerçekten ihtiyaç duyulan bileşenleri seçmek esastır.
Apache NiFi
- Temel ihtiyaç
- Dataflow / veri entegrasyonu
- Ne için kullanılır?
- API, dosya, veritabanı ve mesaj sistemlerinden gelen veriyi görsel akışlarla toplamak, yönlendirmek, filtrelemek ve dönüştürmek.
- Saha örneği
- Fabrika cihazlarından ve ERP API’lerinden gelen veriyi doğrulayıp Kafka’ya ve data lake’e akıtmak.
Apache Hop
- Temel ihtiyaç
- ETL / veri entegrasyonu
- Ne için kullanılır?
- Görsel pipeline ve workflow’larla veri taşıma, dönüştürme, kalite kontrolü ve ETL/ELT süreçleri geliştirmek.
- Saha örneği
- ERP’den satış ve stok verilerini alıp gece çalışan pipeline ile veri ambarına yüklemek.
Apache Kafka
- Temel ihtiyaç
- Event streaming / mesajlaşma
- Ne için kullanılır?
- Sistemler arasında yüksek hacimli, dayanıklı ve gerçek zamanlı event akışı oluşturmak; üretici ve tüketicileri birbirinden ayırmak.
- Saha örneği
- E-ticaret sipariş, ödeme ve clickstream event’lerini anlık analitik sisteme taşımak.
FL
Apache Flume
- Temel ihtiyaç
- Log / event toplama
- Ne için kullanılır?
- Özellikle yüksek hacimli log ve event verilerini güvenilir şekilde Hadoop/HDFS gibi hedeflere taşımak.
- Saha örneği
- Yüzlerce web sunucusunun access loglarını merkezi HDFS ortamına aktarmak.
SQ
Apache Sqoop
- Temel ihtiyaç
- Legacy RDBMS ↔ Hadoop aktarımı
- Ne için kullanılır?
- İlişkisel veritabanları ile Hadoop arasında toplu veri aktarımı için kullanılmıştır; proje Apache Attic’tedir ve yeni projelerde önerilmez.
- Saha örneği
- Eski Hadoop ortamındaki Oracle→HDFS Sqoop job’larını NiFi/Hop/Spark tabanlı modern akışlara dönüştürmek.
Apache Airflow
- Temel ihtiyaç
- Workflow orchestration
- Ne için kullanılır?
- ETL, veri mühendisliği ve analitik iş akışlarını DAG mantığıyla zamanlamak, bağımlılıklarını yönetmek, izlemek ve yeniden çalıştırmak.
- Saha örneği
- Gecelik ERP yüklemesi → Spark dönüşümü → kalite kontrolü → BI refresh zincirini tek DAG ile yönetmek.
Apache Spark
- Temel ihtiyaç
- Dağıtık batch / SQL processing
- Ne için kullanılır?
- Büyük veri üzerinde ETL, batch processing, dağıtık SQL ve streaming iş yüklerini ölçekli biçimde çalıştırmak.
- Saha örneği
- Milyarlarca satış hareketinden günlük müşteri segmentleri ve özet analitik tablolar üretmek.
Apache Flink
- Temel ihtiyaç
- Stateful stream processing
- Ne için kullanılır?
- Event-time, state management ve düşük gecikme gerektiren sürekli veri akışlarını gerçek zamanlı işlemek.
- Saha örneği
- Banka işlemlerinde saniyeler içinde olağan dışı işlem davranışını tespit etmek.
ST
Apache Storm
- Temel ihtiyaç
- Gerçek zamanlı stream processing
- Ne için kullanılır?
- Sürekli gelen event’leri düşük gecikmeyle topology tabanlı olarak işlemek ve sonuçları downstream sistemlere iletmek.
- Saha örneği
- Telekom event akışında anlık sayaç, alarm ve kullanım metrikleri hesaplamak.
PI
Apache Pig
- Temel ihtiyaç
- Büyük veri dönüşümü / ETL
- Ne için kullanılır?
- Pig Latin ile Hadoop verileri üzerinde filter, join, group ve aggregate gibi dönüşümleri yüksek seviyeli ifadelerle gerçekleştirmek.
- Saha örneği
- Mevcut Hadoop ortamındaki uzun MapReduce dönüşümlerini daha okunabilir Pig Latin script’leriyle yönetmek.
Apache Iceberg
- Temel ihtiyaç
- Açık lakehouse table format
- Ne için kullanılır?
- Data lake üzerinde ACID işlemleri, schema evolution, partition evolution, snapshot ve time travel özellikleriyle güvenilir analitik tablolar yönetmek.
- Saha örneği
- Yıllar içinde kolonları ve partition yapısı değişen satış tablosunu Spark, Flink ve BI motorlarının ortak kullanmasını sağlamak.
Delta Lake
- Temel ihtiyaç
- Transactional lakehouse
- Ne için kullanılır?
- Data lake üzerinde ACID transactions, schema enforcement/evolution, time travel ve MERGE/UPDATE/DELETE operasyonları sağlamak.
- Saha örneği
- CRM’den gelen müşteri değişikliklerini lakehouse tablosuna SCD/CDC mantığıyla MERGE etmek.
Apache Hudi
- Temel ihtiyaç
- Incremental lakehouse / CDC
- Ne için kullanılır?
- Upsert, delete, indexing, incremental query ve change-stream odaklı sürekli değişen veri kümelerini yönetmek.
- Saha örneği
- ERP sipariş değişikliklerini yalnızca değişen kayıtları işleyerek data lake’e incremental biçimde aktarmak.
Apache Hive
- Temel ihtiyaç
- Data warehouse / SQL
- Ne için kullanılır?
- Hadoop ve data lake üzerindeki büyük veri kümelerini SQL benzeri sorgularla modellemek ve analiz etmek.
- Saha örneği
- Object storage üzerindeki yıllık işlem geçmişini departmanların SQL ile analiz edebileceği tablolar olarak sunmak.
IM
Apache Impala
- Temel ihtiyaç
- Düşük gecikmeli analitik SQL
- Ne için kullanılır?
- Hadoop tabanlı büyük veri üzerinde interaktif ve düşük gecikmeli SQL sorguları çalıştırmak.
- Saha örneği
- Milyarlarca satış satırını yönetim dashboard’unda saniyeler içinde filtreleyip sorgulamak.
DR
Apache Drill
- Temel ihtiyaç
- Schema-on-read dağıtık SQL
- Ne için kullanılır?
- Parquet, JSON, Hadoop ve farklı veri kaynaklarını önceden klasik şema tanımlamadan SQL ile keşfetmek ve sorgulamak.
- Saha örneği
- Data lake’e yeni düşen yarı yapılandırılmış JSON dosyalarını ETL geliştirmeden hızlıca analiz etmek.
Apache Doris
- Temel ihtiyaç
- Real-Time OLAP / analitik veritabanı
- Ne için kullanılır?
- Yüksek concurrency altında düşük gecikmeli SQL sorguları, real-time dashboard, ad-hoc analysis ve analitik serving ihtiyaçlarını karşılamak.
- Saha örneği
- E-ticaret operasyon merkezinde saniyelik sipariş, ödeme, teslimat ve hata KPI’larını yoğun kullanıcı trafiğinde hızlı sunmak.
HB
Apache HBase
- Temel ihtiyaç
- Dağıtık NoSQL / düşük gecikme
- Ne için kullanılır?
- Çok büyük ve seyrek tablolarda key tabanlı düşük gecikmeli read/write erişimi sağlamak.
- Saha örneği
- Telekom müşterisinin son kullanım hareketlerine müşteri ID üzerinden çok hızlı erişmek.
Apache Cassandra
- Temel ihtiyaç
- Dağıtık operational database
- Ne için kullanılır?
- Çok yüksek yazma hacmi, yatay ölçeklenebilirlik ve yüksek erişilebilirlik gereken distributed uygulama verilerini saklamak.
- Saha örneği
- Milyonlarca IoT cihazından sürekli gelen sensör ölçümlerini kesintiye dayanıklı biçimde saklamak.
KU
Apache Kudu
- Temel ihtiyaç
- Hızlı analitik veri depolama
- Ne için kullanılır?
- Hem hızlı insert/update hem de analitik SQL erişimi gereken mutable structured data için kolon bazlı depolama sağlamak.
- Saha örneği
- Üretim hattındaki güncel makine durumlarını hızlı yazıp aynı veriyi Impala üzerinden interaktif analiz etmek.
Apache CouchDB
- Temel ihtiyaç
- Document database
- Ne için kullanılır?
- JSON dokümanlarını esnek şema, HTTP/REST yaklaşımı ve replikasyon özellikleriyle saklamak.
- Saha örneği
- Saha uygulamasında çevrimdışı oluşturulan form ve gözlem kayıtlarını JSON olarak saklayıp daha sonra senkronize etmek.
IG
Apache Ignite
- Temel ihtiyaç
- In-memory computing / cache
- Ne için kullanılır?
- Dağıtık RAM tabanlı cache, düşük gecikmeli data access ve compute ihtiyaçlarını karşılamak.
- Saha örneği
- Sık kullanılan müşteri fiyatlandırma ve kural verilerini bellekte tutarak uygulama yanıt sürelerini düşürmek.
Apache Lucene
- Temel ihtiyaç
- Arama motoru kütüphanesi
- Ne için kullanılır?
- Uygulamaların içine full-text search, indexing, scoring ve metin arama yetenekleri eklemek için temel search engine kütüphanesi sağlamak.
- Saha örneği
- Doküman yönetim sisteminde milyonlarca sözleşme ve rapor içinde içerik bazlı arama geliştirmek.
Apache Solr
- Temel ihtiyaç
- Kurumsal arama platformu
- Ne için kullanılır?
- Lucene tabanlı full-text search, faceting, distributed indexing, replication ve search API yeteneklerini hazır servis olarak sunmak.
- Saha örneği
- E-ticaret sitesinde ürün adı, kategori, marka, özellik ve facet filtreleriyle hızlı ürün araması sunmak.
Apache Superset
- Temel ihtiyaç
- BI / visualization
- Ne için kullanılır?
- SQL tabanlı veri kaynaklarından dashboard, veri keşfi, semantic metrics ve embedded analytics deneyimleri oluşturmak.
- Saha örneği
- Satış, kârlılık ve operasyon KPI’larını yöneticilere web tabanlı interaktif dashboard olarak sunmak.
Iceberg multi-engine birlikte çalışabilirliği, açık table-format yaklaşımı ve schema/partition evolution ile; Delta Lake ACID, MERGE ve Spark merkezli transactional lakehouse kullanımında; Apache Hudi ise CDC, upsert ve incremental pipeline senaryolarında öne çıkar. Seçim mevcut engine’ler, update yoğunluğu ve platform bağımsızlığı beklentisine göre yapılmalıdır.
Ürünleri değil,
veri akışını tasarlıyoruz.
Bir mimaride tüm bileşenlerin Apache olması gerekmez. Örneğin kaynak sistemlerden NiFi/Hop ile veri alınabilir, Airflow ile iş akışları yönetilebilir, Spark/Flink ile veri işlenebilir, Iceberg, Delta Lake veya Hudi üzerinde lakehouse tabloları oluşturulabilir, Doris/Impala ile sorgulanabilir ve Superset ile kullanıcıya sunulabilir.
Iceberg, Delta Lake ve Hudi:
hangisi ne zaman öne çıkar?
Bu üç teknoloji aynı probleme farklı önceliklerle yaklaşır. Seçimde yalnızca popülerlik değil; compute engine çeşitliliği, CDC/upsert yoğunluğu, streaming modeli, platform bağımlılığı ve operasyon ekibinin yetkinliği dikkate alınmalıdır.
Multi-engine lakehouse, açık table format, hidden partitioning ve güçlü schema/partition evolution.
ACID, MERGE/UPDATE/DELETE, schema enforcement ve batch-stream birleşimi; özellikle Spark merkezli mimarilerde güçlü.
CDC, upsert/delete, indexing ve incremental processing; sürekli değişen verinin lake'e taşınmasında güçlü.
BI ağırlıklı çoklu motor erişiminde Iceberg; Spark merkezli transactional lakehouse yaklaşımında Delta Lake; yoğun CDC/upsert ve incremental pipeline senaryolarında Hudi öne çıkabilir. Kurumsal seçim, gerçek workload üzerinde proof of concept ile doğrulanmalıdır.
Hangi Apache ürününü seçmelisiniz?
Bu soruya ürün isimleriyle başlamak çoğu zaman yanlış mimariye götürür. Önce veri akışının SLA'sı, batch/stream gereksinimi, veri büyüklüğü, sorgu concurrency'si, recovery beklentisi, ekip yetkinlikleri ve mevcut altyapı belirlenmelidir.
Önce iş yükünü sınıflandırıyoruz
Gerçek zamanlı event processing mi, günlük batch ETL mi, interaktif SQL mi, geniş ölçekli key-value erişimi mi, full-text search mü? Her gereksinimin doğru teknoloji sınıfı farklıdır.
Sonra birlikte çalışabilirliği değerlendiriyoruz
Apache ekosisteminin en önemli avantajlarından biri farklı projelerin açık standartlar ve connector'lar üzerinden birlikte çalışabilmesidir. Iceberg'in Spark ve Flink gibi motorlarla; Airflow'un çok sayıda Apache provider ile; Doris'in Flink/Spark ve BI araçlarıyla entegrasyonu buna örnektir. Lakehouse katmanında ise yalnızca Apache projelerini değil, Delta Lake gibi Apache dışındaki açık teknolojileri de tarafsız biçimde değerlendiriyoruz.
Operasyon maliyetini tasarıma dahil ediyoruz
Açık kaynak lisans maliyetini azaltabilir; ancak cluster yönetimi, güvenlik, monitoring, upgrade, backup ve yetkin insan kaynağı maliyeti devam eder. Bu nedenle mimari yalnızca teknik kabiliyete göre değil, toplam sahip olma maliyetine göre de değerlendirilmelidir.
Apache ürünlerini yalnızca açık kaynak oldukları için önermiyoruz. Kurumunuzun mevcut Microsoft, Qlik, cloud veya SQL yatırımlarını koruyarak açık kaynak bileşenlerin gerçekten değer yarattığı katmanlarda hibrit mimariler tasarlıyoruz.
Apache Data Ecosystem hakkında sık sorulanlar
Apache Data Ecosystem nedir?
Apache Data Ecosystem tek bir ürün değil; veri entegrasyonu, orkestrasyon, batch ve stream processing, lakehouse tablo formatları, analitik SQL, dağıtık veri depolama ve arama gibi farklı ihtiyaçları karşılayan açık kaynak Apache projelerinin birlikte kullanılabildiği geniş bir teknoloji ekosistemidir.
Bu Apache ürünlerinin hepsini aynı projede kullanmak gerekir mi?
Hayır. Doğru yaklaşım teknoloji sayısını artırmak değil, ihtiyaca göre en az sayıda doğru bileşeni seçmektir. Örneğin Airflow orkestrasyon, Spark batch processing ve Iceberg lakehouse tabloları için birlikte kullanılabilirken başka bir senaryoda Flink, Doris ve Superset daha uygun olabilir.
Apache Spark ile Apache Flink arasındaki temel fark nedir?
Her ikisi de dağıtık veri işleme platformudur. Spark batch, SQL, data science ve streaming iş yüklerini tek ekosistemde birleştirirken; Flink özellikle stateful stream processing, event-time ve düşük gecikmeli sürekli veri akışlarında güçlüdür. Seçim iş yükü ve operasyon modeline göre yapılmalıdır.
Apache Iceberg bir veritabanı mıdır?
Hayır. Iceberg büyük analitik veri kümeleri için açık bir table formatıdır. Spark, Flink, Hive ve Impala gibi motorların aynı veri dosyalarını güvenli ve tutarlı tablolar olarak kullanmasına yardımcı olur.
Iceberg, Delta Lake ve Apache Hudi arasındaki fark nedir?
Üçü de data lake üzerinde güvenilir tablo yönetimi sağlar; ancak odakları farklıdır. Iceberg çoklu engine birlikte çalışabilirliği ve açık table-format yaklaşımıyla, Delta Lake güçlü ACID işlemleri ve batch-stream birleşimiyle, Apache Hudi ise upsert, CDC ve incremental processing odaklı iş yükleriyle öne çıkar. Seçim veri işleme motoru, update yoğunluğu ve platform bağımsızlığı beklentisine göre yapılmalıdır.
Apache Sqoop yeni projelerde öneriliyor mu?
Apache Sqoop 2021 yılında emekliye ayrılarak Apache Attic’e taşınmıştır. Bu nedenle yeni mimarilerde aktif bir teknoloji tercihi olarak önermiyoruz; mevcut legacy Hadoop sistemlerini değerlendirirken ve modernizasyon planı oluştururken ele alıyoruz.
Apache Pig bugün hâlâ kullanılıyor mu?
Evet. Apache Pig aktif bir Apache projesidir ve 0.18.0 sürümü Eylül 2025’te yayımlanmıştır. Bununla birlikte yeni greenfield veri platformlarında Spark SQL, Hive veya modern ELT yaklaşımları daha sık tercih edildiği için Pig özellikle mevcut Hadoop/Pig Latin iş yüklerinin bakımı ve modernizasyonunda önem taşır.
Apache Superset bu ekosistemin neresinde yer alır?
Superset veri işleme veya veri ambarı değildir; işlenmiş ve sorgulanabilir verinin kullanıcıya dashboard ve veri keşfi katmanı olarak sunulduğu analitik tüketim katmanında konumlanır. Spark SQL, Doris, Impala ve desteklenen diğer SQL veri kaynaklarıyla birlikte kullanılabilir.
Mevcut veri mimarinizi birlikte değerlendirelim.
Hadoop tabanlı legacy sistemlerden modern lakehouse mimarisine, batch ETL'den gerçek zamanlı streaming'e veya kapalı ürünlerden açık kaynak bileşenlere geçiş için uygulanabilir bir yol haritası oluşturalım.
Projenizi Konuşalım →