Veri Bilimciler için Yapay Zeka Rehberi: Çalışmanızı Hızlandıracak Yeni Nesil Araçlar

 Giriş Veri bilimci olmak eskiden daha farklıydı: Python kütüphaneleri, SQL sorguları, uzun önişleme süreçleri… Bugün ise yepyeni bir dönem başladı. Yapay zekâ destekli platformlar, veri bilimcilere sadece hız kazandırmıyor, aynı zamanda tek kişinin büyük ekiplerin işini yapabilmesini mümkün kılıyor. Bu yazıda hem çekirdek AI araçlarını hem de keşfetmeye değer yenilikçi platformları ele alacağız. Her birinin […]

Veri Madencilerinin Yeni Süper Gücü: Apify ile Kod Yazmadan Veri Toplama ve Otomasyon

Veri bilimi, günümüz dijital dünyasında kurumlar için en kritik rekabet avantajlarından birini sunuyor. Büyük veri setlerinden anlamlı içgörüler çıkarmak ve geleceğe yönelik isabetli tahminler yapmak, hem bireyler hem de kurumlar için vazgeçilmez bir yetenek haline geldi. Ancak, her başarılı veri bilimi projesinin temelinde yatan en önemli unsur, kaliteli ve erişilebilir veridir. Veri bilimcilerin karşılaştığı en […]

Manus AI: Veri Bilimcilerin Yeni Süper Gücü – Sadece İsteyin, Gerisini Manus Halletsin!

Veri Bilimi, günümüz dünyasında giderek artan bir öneme sahip. Büyük veri setlerinden anlamlı içgörüler elde etme ve geleceğe yönelik tahminler yapma yeteneği, hem bireyler hem de kurumlar için kritik bir rol oynamaktadır. Ancak, veri bilimcilerin karşılaştığı zorluklar da azımsanmayacak kadar fazladır: büyük veri setlerinin yönetimi, tekrarlayan görevlerin otomasyonu, model geliştirme süreçlerinin karmaşıklığı ve sürekli değişen […]

Julius AI ile Veri Madenciliği ve Analizi

Veri biliminin sürekli gelişen dünyasında, Julius AI gibi araçlar, veri bilimcilerinin çalışma biçimini kökten değiştiren bir devrimi temsil etmektedir. Geleneksel olarak zaman alıcı ve teknik bilgi gerektiren veri toplama, temizleme, analiz etme ve görselleştirme süreçleri, Julius AI sayesinde doğal dil komutlarıyla çok daha hızlı ve verimli bir şekilde gerçekleştirilebilmektedir. Bu, veri bilimcilerinin rutin görevlerin ötesine geçerek, daha karmaşık problemlere odaklanmalarına ve stratejik içgörüler üretmelerine olanak tanır.

Spark ML Custom Transformer Yazma

Bu yazımızda Spark ML Custom Transformer yazacağız. Spark’ın makine öğrenimi kütüphanesi (MLlib), veri bilimcilere ve makine öğrenimi mühendislerine zengin bir araç seti sunuyor. Model geliştirme çalışmalarında bilhassa özellik mühendisliği (feature engineering) aşamasında çok yoğun veri ön hazırlık süreçleri oluyor.  Bu çalışmalarda  PySpark’ın pyspark.ml.feature kütüphanesi, makine öğrenimi modelleriniz için ham verileri anlamlı ve kullanışlı özelliklere (feature) […]

Scikit-Learn Spark Deployment

Makine öğrenimi modelleri, günümüzde birçok alanda veri analizinin ve tahminlerin temelini oluşturuyor. Scikit-learn ise en başından beri Python ile yapılan çalışmalarda, basit arayüzü ve geniş algoritma yelpazesi ile ML çalışmalarında en yaygın kütüphane. Ancak, scikit-learn  ile büyük veri kümelerinde çalışmak, performans ve ölçeklenebilirlik açısından bazı zorluklar doğurabiliyor. Bu noktada, büyük veri üzerindeki başarısıyla meşhur Apache Spark […]

Veri Sürüm Kontrolü: Yazılımdan Veri Dünyasına

Yazılım dünyasında vazgeçilmez bir unsur olan sürüm kontrolü (version control), son yıllarda veri yönetimi ve analizinde de kendine sağlam bir yer edinmeye başladı. Peki, bu kavram nereden ortaya çıktı ve veri dünyasında neden bu kadar önemli hale geldi? Yazılımın Dünyasında Sürüm Kontrolü Yazılım geliştirme süreçlerinde, bir projenin değişimlerini takip etmek, farklı versiyonlarını yönetmek ve ekip […]

Oppenheimer Filmi ve Nükleer Bombaların Gölgesinde Veri Biliminin Önemi

Son birkaç haftadır adından çokça söz ettiren “Oppenheimer” filmi, nükleer bombaların tarihi ve etkileri hakkında izleyenlere derin bir bakış sunuyor. Bu tür filmler, tarihin en karanlık ve tehlikeli dönemlerinden birine işaret ederek insanlığın karşı karşıya kaldığı nükleer tehditlerin hala ne kadar güncel olduğunu hatırlatıyor. Nükleer güvenlik, hâlâ uluslararası ilişkilerde ve küresel politikada en önemli konulardan […]

Ray: Python ile Dağıtık Veri İşleme

Ray, gerçek zamanlı veri işleme sistemleri ve yapay zeka araştırmalarının yapıldığı RISELab tarafından 2017’de başlatılan bir projedir. Apache 2.0 lisansına sahip olan Ray, açık kaynaklı bir kütüphane olarak paralel ve dağıtık hesaplamaya odaklanarak geliştirilmeye başlanmıştır. Ray, son zamanlarda veri bilimcileri ve Python programcıları tarafından veri analitiği, yapay zeka ve makine öğrenimi projelerinde sıkça kullanılan bir […]

TEMPORAL FUSION TRANSFORMER

Bu yazımda sizlere Google’ın yakın zamanda geliştirmiş olduğu Temporal Fusion Transformer (TFT) mimarisini açıklamak ve Python’da örnek bir veri seti üzerinden uygulama yapmak istiyorum. Gün geçmiyor ki makine öğrenme algoritmalarının bir yenisi çıkmasın ve bir ihtiyaca merhem olmasın. Bugün sizlere tanıtımını yapacağım TFT derin öğrenme mimarisi, zaman serileri üzerine güven aralıklarıyla tahmin üretebilen bir mimari/yöntemdir. […]

Pandas: Veri Türleri Üzerindeki Perdeyi Kaldırın

Merhabalar bu yazımızda: “Pandas dataframe veri türlerini nasıl görebiliriz?” sorusunun cevabını iki farklı yöntemi mukayese ederek öğreneceğiz. Aslında bir nevi pandas dataframe şeması üzerinde keşif yapacağız. “Okudum veriyi oldu bitti” deyip dümdüz, tam gaz ilerlemeyin. İleride başınıza neler gelebilir dikkat edin. Aslında dataframe nesnesinin dtypes özelliği var oradan çok kolay veri türlerini öğrenebiliriz niçin böyle […]

Pandas Dataframe’i Veri Tabanına Yazmanın En Kötü Yolu

Pandas dataframe veri bilimci ve mühendisleri tarafından çok yaygın kullanılan bir araç. Veriyi şekilden şekile sokmak için birebir. Veriyi istediğimiz hale getirdikten sonra çoğu zaman bir yere yazıp saklamak isteriz. Eğer saklanacak yer bir veri tabanı olacak ise bunun bir kaç farklı yöntemi var. Bunlardan birisi de pandas dataframe to_sql metodu. to_csv’ye çok alışığız, bu […]

MySQL Upsert İçin Alternatif Bir Yaklaşım

İş ihtiyacını karşılayacak şekilde temiz, doğru, güvenilir, istenen formatta, gıcır gıcır veri tabanında bekleyen bir veriyi kim sevmez ki 🙂 Mesela Mysql’de. Elbette herkes sever ancak bunu sağlayacak olan sağlam işleyen veri akış hatlarıdır (data pipelines). Veri akış hatları bilgi sistemi kullanan küçük veya büyük her örgüt için olmazsa olmaz bir zorunluluk haline geldi. Artık […]

Derin Öğrenme ile BBC Haberlerinin Sınıflandırılması

Merhabalar! Bu yazımda derin öğrenme (deep learning) yöntemlerinden evrişimli sinir ağları (convolutional neural networks – CNN) ve uzun kısa süreli bellek (Long short-term memory – LSTM) modelini kullanarak çoklu sınıflandırma problemini ele alacağım. Bunun yanında ilgilendiğimiz haberleri, manifold öğrenme algoritmaları arasında en popüler olan t-SNE (t-Distributed Stochastic Neighbor Embedding) ile görselleştireceğiz. Veri Seti Bu çalışma kapsamında BBC’e (British Broadcasting Corporation) ait […]

Dengesiz Veri Setlerinde Modelleme

Standart bir sınıflandırıcı makine öğrenmesi algoritmasının amacı doğruluğu maksimize etmektir. Dengesiz veri setlerinde ise algoritma, veri sayısı çok olan sınıfı daha iyi öğrenecektir ve bu eğitimin sonucu çoğunluk sınıfı için düşük hata oranı, ancak azınlık sınıfı için daha yüksek hata oranı olacaktır.

SSIS’de Conditional Split

Daha önceki SSIS (SQL Server Integration Services) konulu yazılarımda,  farklı kaynaklardaki verileri kullanarak amacımıza uygun şekillerde dönüşümler gerçekleştirmiştik. Daha sonra ise hedef çıktımızı tek bir kaynağa indirgemiştik. Bu yazıda ise tam tersi; kaynak verimizi farklı çıktılara nasıl dağıtacağımızı SSIS’de Conditional Split kullanarak göreceğiz.

Boruta Algoritması ile Değişken Seçimi

Boruta veri setine eklediği gölge değişkenler ve iterasyonlu yapısı ile bir veri setinden önemli ve önemli olmayan değişkenlerin tarafsız ve istikrarlı bir şekilde seçilmesini sağlayan, Random Forest tabanlı değişken seçme yöntemidir.

SSIS’de Union All

Bu yazımda SSIS’de Union All görevini kullanmayı göreceğiz. Örnek paket çalıştırarak SSIS’de neden Union All var ve nasıl kullanılır konularına değinmiş olacağız.

MXNet ile Derin Öğrenme 2.1: Softmax Regresyon (Teori)

Herkese merhabalar, MXNet ile derin öğrenme serisine devam ediyoruz. İlk iki bölümde doğrusal regresyon konusunda teorik bilgiler paylaşıp python programlama dili ile uygulama yapmıştık. Bu bölümde softmax regresyon konusunda teorik bilgiler paylaşılacaktır. Doğrusal regresyon teori kısmına buradan Doğrusal regresyon uygulama kısmına buradan ulaşabilirsiniz. Regresyon, ne kadar veya kaç tane? gibi sorulara cevap vermek ıstediğimizde kullandığımız […]

Hiyerarşik Kümeleme

Merhabalar! Uzun bir aradan sonra yine sizlerleyim 🙂 Bu yazımda denetimsiz öğrenme (unsupervised learning) algoritmalarından hiyerarşik kümelemeyi ele alacağız. İlk olarak denetimsiz öğrenme nedir? Denetimsiz Öğrenme Denetimli öğrenmede (supervised learning) bilindiği üzere etiket bilgisine sahip verilerle çalışıyoruz. Buna karşılık denetimsiz öğrenmede (Gözetimsiz Öğrenme / Kümeleme) elimizde sadece girdi verileri bulunuyor. Herhangi bir sınıf (etiket) bilgisine sahip değiliz. Denetimsiz […]