Erkan ŞİRİN – Sayfa 4 – Veri Bilimi Okulu

Gerçekçi Bir Yapay Zeka Mühendisi (AI Engineer) Yol Haritası

Bir kavram popüler olunca fırsatı değerlendirmek isteyenler çok oluyor. Son zamanlarda yapay zeka dünyasında kariyer yapmak isteyenler için “sadece birkaç ayda AI Engineer (yapay zeka mühendisi) olun” vadeden birçok içerik internette dolaşıyor. Ancak bu işleri bilen ve tecrübeli olanlar, özellikle hedef büyük bir teknoloji şirketinde AI Mühendisi olmak ise, bunun için önemli bir zaman ve […]

Yeni Başlayanlar İçin Prompt Engineering

Merhaba! Bugün sizlerle yapay zeka dünyasının en heyecan verici becerilerinden biri olan prompt engineering’i (istem mühendisliği) konuşacağız. ChatGPT, Claude, Gemini gibi yapay zeka araçlarını kullanırken bazen istediğiniz cevabı alamadığınız oldu mu? İşte size “prompt engineering nedir?” cevabı. Prompt Engineering Nedir? Prompt engineering, büyük dil modellerine (LLM) sağlanan komutları, girdi sorgularını veya talimatları tasarlamak ve yapılandırmak […]

Yapay Zeka Mühendisliğinin (AI Engineering) Yükselişi

Yapay zeka alanında yaşanan gelişmeler, iş dünyasında daha önce benzeri görülmemiş bir değişime yol açıyor. Bir zamanlar yalnızca bilim kurgu filmlerinde gördüğümüz teknolojiler artık günlük hayatımızın ve iş dünyasının vazgeçilmez bir parçası haline geldi. Bu dönüşümün merkezinde ise AI Engineer (Yapay Zeka Mühendisleri) yer alıyor. Yakın zamana kadar 21. yüzyılın ek seksi mesleği datascientist olarak […]

DocLing: Yapay Zekada Belgelerle Çalışmak

Docling sahnede. Yapay zeka ve büyük dil modellerinin (LLM) en büyük gücü, kendi verilerimizi kullanabilme imkanı sunmalarıdır. Ancak, bir çok veri PDF, Word (docx) veya PowerPoint gibi formatlarda tutulduğu için bunları adam akıllı yapay zeka ile buluşturmak zor bir iş. Veri var, yapay zeka var ama o Yeşilçam buluşması bir türlü gerçekleşmiyor. Çünkü bu tür […]

LangChain ve Qdrant ile Vector Store Kullanımı: Türkçe Bir Rehber

Merhaba! Bu blog yazısında, LangChain ve Qdrant kullanarak nasıl bir vektör veritabanı oluşturabileceğinizi ve bu sistemi soru-cevap uygulamaları gibi senaryolarda nasıl kullanabileceğinizi adım adım açıklayacağım. docker-compose.yaml dosyası ile bir qdrant konteyner ayağa kaldıracağız ve langchain ile vektör veri tabanı oluşturup, içine soru cevap dokümanı indeksleyip sorgulayacağız. Neden LangChain ve Qdrant? LangChain, doğal dil işleme (NLP) […]

Airflow-GitHub Entegrasyonu: GitHub DAG Dosyalarınız Anında Airflow’da

Aralık 2025 güncelleme: Airflow 2 kullanıyorsanız devam edin. Airflow 3 ile bu işin daha doğal ve kolay bir yolu var artık. Bu yazıda Airflow-Github veri akışları (data pipelines) orkestrasyonu için sektörde yaygın olarak kullanılan bir ikili. Python ile yazdığınız DAG dosyaları Airflow ile buluştuğunda Airflow bu DAG dosyalarında sizin kendisine ne iş yaptırmak istediğinizi anlıyor […]

Linux Container SSH Bağlantısı

Bu yazıda özetle bir docker konteynerden diğerine ssh (container to container ssh) ile bağlanma örneği yapacağız. İş hayatında sık sık bir uzak linux sunucuya bağlanıyoruz. Bu bağlantı için SSH protokolünü kullanıyoruz. Teknik olarak SSH (Secure Shell), bir ağ üzerinden iki bilgisayar arasında güvenli bir şekilde veri alışverişi ve uzaktan oturum açma imkanı sağlayan bir kriptografik […]

Spark ML Custom Transformer Yazma

Bu yazımızda Spark ML Custom Transformer yazacağız. Spark’ın makine öğrenimi kütüphanesi (MLlib), veri bilimcilere ve makine öğrenimi mühendislerine zengin bir araç seti sunuyor. Model geliştirme çalışmalarında bilhassa özellik mühendisliği (feature engineering) aşamasında çok yoğun veri ön hazırlık süreçleri oluyor. Bu çalışmalarda PySpark’ın pyspark.ml.feature kütüphanesi, makine öğrenimi modelleriniz için ham verileri anlamlı ve kullanışlı özelliklere (feature) […]

Scikit-Learn Spark Deployment

Makine öğrenimi modelleri, günümüzde birçok alanda veri analizinin ve tahminlerin temelini oluşturuyor. Scikit-learn ise en başından beri Python ile yapılan çalışmalarda, basit arayüzü ve geniş algoritma yelpazesi ile ML çalışmalarında en yaygın kütüphane. Ancak, scikit-learn ile büyük veri kümelerinde çalışmak, performans ve ölçeklenebilirlik açısından bazı zorluklar doğurabiliyor. Bu noktada, büyük veri üzerindeki başarısıyla meşhur Apache Spark […]

Polars ClickHouse Veri Okuma ve Yazma

Ham verinin düzenli olarak temizlenerek analitik ortamlarda istiflenmesi ve buradan da analiz, görselleştirme ve yapay zeka çalışmalarının yapılması hemen hemen her işletmede standart, temel ve önemli bir ihtiyaç haline geldi. Temiz, düzgün ve güvenilir verinin biriktiği ortamların başında veri ambarları geliyor. Veri işlemek ve analiz etmek için ise bir çok araç mevcut. ClickHouse veri ambarının […]

Docker ile Kolay ve Hızlı Apache Airflow Kurulumu

Veri mühendisliği, analitik ve makine öğrenmesi projelerinde, iş akışlarını yönetmek ve otomatikleştirmek için güçlü bir araç arıyorsanız, Apache Airflow ilk seçeneklerden birisi olacaktır. Airflow, karmaşık veri işleme görevlerini planlamanıza, yürütmenize ve izlemenize olanak tanıyan popüler bir açık kaynaklı platformdur. Ancak, Airflow’u öğrenmek isteyenlerin Airflow kurmaları gerekiyor. Klasik yöntemlerle (işletim sistemi üzerinde bir servis olarak) kurmak […]

Docker ile Hızlı ve Kolay PySpark ve Jupyter Kurulumu

Büyük veri analizi, günümüzün veri odaklı dünyasında giderek daha önemli hale geliyor. PySpark ve Jupyter Notebook, bu alanda en popüler araçlardan ikisi. PySpark, büyük veriyi işlemek için son derece hızlı ve ölçeklenebilir bir araçken, Jupyter Notebook ise PySpark ile etkileşimli veri analizi ve görselleştirme çalışmaları için sade ve konforlu bir ortam sunar. Ancak, PySpark ve […]

Apache Spark, Minio, Nessie Catalog, Iceberg ve Docker ile Lakehouse Örneği

Veri ambarı (data warehouse) ile veri gölünün (data lake) en iyi yönlerini birleştirerek bizlere ilişkisel veri tabanı konforunu büyük veri üzerinde sunan lakehouse çözümleri gün geçtikçe hayatımızdaki yerini alıyor. Bugün burada tamamen açık kaynak kodlu bileşenleri kullanarak docker üzerinde basit bir lakehouse örneği yapacağız. 1. Altyapıyı Oluşturan Bileşenler 1.1. Nessie Nessie veri gölleri için transactional […]

Kafka Connect Nedir?

Kafka Connect, Apache Kafka’nın tamamlayıcı bir parçasıdır ve diğer sistemleri Kafka ile entegre eder. Örneğin Kafka Connect, değişiklikleri bir veritabanından (source) Kafka’ya aktarmak ve buradan başka bir veri depolama sistemine (sink) yazmak için kullanılabilir, böylelikle diğer uygulamaların/servislerin (örneğin dashboard) gerçek zamanlı veriye erişimini sağlar. Kafka Connect, içinde Kafka’nın da vazgeçilmez bir parçası olduğu sağlam data […]

AWS Glue ile Basit Bir ETL Uygulaması

AWS Glue, birden çok kaynaktan veri keşfetmeyi, hazırlamayı, taşımayı ve entegre etmeyi kolaylaştıran sunucusuz bir veri entegrasyon hizmetidir. AWS üzerinde ETL ihtiyaçları genellikle Glue ile karşılanır. Bu yazımızda S3 üzerindeki csv dosyalarını parquet formatına çeviren basit bir AWS Glue ETL Job oluşturacağız. Parquet dosyaları analitik sorgular için CSV’ye göre daha performanslıdır ve daha az yer […]

Apache Spark’ı Hangi Ortamlarda Kullanabiliriz?

Apache Spark büyük veri ve analitik dünyada çok popüler bir araç. Spark’ı bir çok farklı amaçla kullanabileceğimiz gibi bir çok farklı ortamda çalıştırabiliriz. Bu yazımızda Spark’ı hangi ortamlarda çalıştırıp kullanabiliriz onlardan bahsedeceğiz. Lokal Java yüklü herhangi bir bilgisayar veya sunucuda Spark binary dosyalarını indirip lokal modda Spark’ı kullanabilirsiniz. Geliştirme yapmak ve öğrenmek için ideal bir […]

FastAPI, Docker ve Terraform ile ML Model Deployment

Yapay öğrenme, veri bilimi ve makine öğrenmesi son yılların en popüler kavramlarından. Model deployment öncesinde bir çok insan bu alanda, özellikle model geliştirme sürecinde bilgi sahibi olmak ve yetenek kazanmak için çabalıyor. Bu kadar ilgi olmasına rağmen ne yazık ki model geliştirmek ve iyi bir başarı skoru elde etmekle sürecin sona erdiği gibi bir eksik […]

ML Modelini Object Storage’a Depolama

Merhaba. Bu yazımızda ml modellerinin object sotrage’a nasıl kaydedileceğini ve gerektiğinde buradan okunarak nasıl kullanılacağını MinIO örneği üzerinden öğreneceğiz. Model scikit-learn kütüphanesiyle geliştirilmiş bir pipeline model olacaktır. Niçin modelleri object storage’a kaydetmek iyidir? Geliştirilen modeli lokal diske kaydettiğimizde ona sadece biz erişebiliriz. Aslında geliştirilen her model bir gün canlı ortamda çalışma hayaline sahiptir, ancak bir […]

Apache Flink ile Kafka’dan Mesaj Okuma (Scala)

Herkese merhaba. Apache Flink gerçek zamanlı veri işleme konusunda oldukça başarılı ve popüler bir araç. Böyle olmasına rağmen ilginç bir şekilde Flink öğrenmek için yeterli kaynak ve güncel örnekler bulmak zor. Mesela benzer bir araç olan Apache Spark ile tonlarca kitap, kurs, makale ve örnek varken Flink’te bunun onda biri bile yok. Daha önce Apache […]

AWS Lambda Function Custom Layer: Pandas Örneği

Selamlar. Bu yazımızda AWS Lambda function içinde nasıl pandas kullanabiliriz onu öğreneceğiz. (Ekim 2025 güncelleme) Aslında pandas da dahil olan AWS’nin kendi layer’ı var. Siz bu yazıyı kendi özgün katmanınızı nasıl oluşturabilirsiniz ona örnek olarak düşünün. Python pandas veri manipülasyonunda en yaygın kullanılan paketlerden birisi. Kendi bilgisayarımızda, notebook sunucusunda, Google Colab’da ve başka bir çok […]

Yazar: Erkan ŞİRİN