Manus AI: Veri Bilimcilerin Yeni Süper Gücü – Sadece İsteyin, Gerisini Manus Halletsin!

Veri Bilimi, günümüz dünyasında giderek artan bir öneme sahip. Büyük veri setlerinden anlamlı içgörüler elde etme ve geleceğe yönelik tahminler yapma yeteneği, hem bireyler hem de kurumlar için kritik bir rol oynamaktadır. Ancak, veri bilimcilerin karşılaştığı zorluklar da azımsanmayacak kadar fazladır: büyük veri setlerinin yönetimi, tekrarlayan görevlerin otomasyonu, model geliştirme süreçlerinin karmaşıklığı ve sürekli değişen […]
Julius AI ile Veri Madenciliği ve Analizi

Veri biliminin sürekli gelişen dünyasında, Julius AI gibi araçlar, veri bilimcilerinin çalışma biçimini kökten değiştiren bir devrimi temsil etmektedir. Geleneksel olarak zaman alıcı ve teknik bilgi gerektiren veri toplama, temizleme, analiz etme ve görselleştirme süreçleri, Julius AI sayesinde doğal dil komutlarıyla çok daha hızlı ve verimli bir şekilde gerçekleştirilebilmektedir. Bu, veri bilimcilerinin rutin görevlerin ötesine geçerek, daha karmaşık problemlere odaklanmalarına ve stratejik içgörüler üretmelerine olanak tanır.
Spark ML Custom Transformer Yazma

Bu yazımızda Spark ML Custom Transformer yazacağız. Spark’ın makine öğrenimi kütüphanesi (MLlib), veri bilimcilere ve makine öğrenimi mühendislerine zengin bir araç seti sunuyor. Model geliştirme çalışmalarında bilhassa özellik mühendisliği (feature engineering) aşamasında çok yoğun veri ön hazırlık süreçleri oluyor. Bu çalışmalarda PySpark’ın pyspark.ml.feature kütüphanesi, makine öğrenimi modelleriniz için ham verileri anlamlı ve kullanışlı özelliklere (feature) […]
Pandas: Veri Türleri Üzerindeki Perdeyi Kaldırın

Merhabalar bu yazımızda: “Pandas dataframe veri türlerini nasıl görebiliriz?” sorusunun cevabını iki farklı yöntemi mukayese ederek öğreneceğiz. Aslında bir nevi pandas dataframe şeması üzerinde keşif yapacağız. “Okudum veriyi oldu bitti” deyip dümdüz, tam gaz ilerlemeyin. İleride başınıza neler gelebilir dikkat edin. Aslında dataframe nesnesinin dtypes özelliği var oradan çok kolay veri türlerini öğrenebiliriz niçin böyle […]
Derin Öğrenme ile BBC Haberlerinin Sınıflandırılması

Merhabalar! Bu yazımda derin öğrenme (deep learning) yöntemlerinden evrişimli sinir ağları (convolutional neural networks – CNN) ve uzun kısa süreli bellek (Long short-term memory – LSTM) modelini kullanarak çoklu sınıflandırma problemini ele alacağım. Bunun yanında ilgilendiğimiz haberleri, manifold öğrenme algoritmaları arasında en popüler olan t-SNE (t-Distributed Stochastic Neighbor Embedding) ile görselleştireceğiz. Veri Seti Bu çalışma kapsamında BBC’e (British Broadcasting Corporation) ait […]
Boosting Kutu Açılışı

En sık kullanılan boosting algoritmalarının kullanımı, hiperparametre optimizasyonu ve performansları Python dili kullanılarak incelenmiştir.
Özellik Oluşumu ve Özellik Seçimi(Feature Selection)-2

Merhaba Arkadaşlar, Özellik seçimi ile ilgili yazı serisinin 2.yazısını okumaktasınız, eğer ilk yazıyı okumadıysanız ilk yazıyı okumanız konu bütünlüğünü anlamak adına faydanıza olacaktır. İlk yazıda temel temizlik ve bazı istatistiksel yöntemleri açıklamaya çalıştım. En basit yöntem olan tüm değişkenlerin tüm kombinasyonlarını kullanarak karar verme süreci çok uzun ve maliyetli bir işlem olduğunu söylemiştim. 1.yazıda anlattığımız […]
Özellik Oluşumu ve Özellik Seçimi(Feature Selection)-1

Makine öğrenmesinde özellik seçimi yöntemleri nelerdir?
GNU/Linux üzerinde Bash Komutları ile Veri Seti Keşfi ve Ön İşleme-2

Merhaba, GNU/Linux komutları ile veri seti keşfi ve ön işleme yolculuğa devam ediyoruz. İlk yazımız da yaygın olarak kullanılan komutları [ wget, cat, tac, head, tail, wc, cut, tr, sort, shuf ] iris veri seti üzerinde irdelemiştik. Dilerseniz ilk yazıya buradan erişim sağlayabilirsiniz. Bugünkü içeriğe bakacak olursak; echo nl split paste uniq sed awk shell […]
Veri Hazırlığının Vazgeçilmezi : Özellik Ölçeklendirme

Merhaba VBO okuyucuları! Bu yazımda sizlere veri hazırlığında çok önemli yeri olan ve Feature Scaling olarak da bilinen ‘Özellik Ölçeklendirme’ kavramından ve yöntemlerinden bahsedeceğim. Verileri modele vermeden önce dikkat edilmesi gereken önemli noktalardan bazıları şunlardır: Verinin dağılımı: Verinin normal dağılıp dağılmaması, bazı algoritmaların çalışmasını etkileyen bir faktör. Veriler sağa yatık, ya da sola yatıksa, model […]
Tensorflow Lite Modeli ile Colab Üzerinden Görüntü Sınıflandırma: Derin Öğrenme Uygulaması

Bildiğiniz üzere derin ağlarda / katmanlarda öğrenme işlemine biz kabaca derin öğrenme diyoruz. Bu açıklama tam karşılığı olmasa da gözünüzde bu şekilde canlandırabilirsiniz. Bu ay, yazımda sizlerle çok faydalı olacağına inandığım ve Türkçe kaynak açısından eksik bilgilerin olduğu bir konuyu ele almak istiyorum. Bu yazımda önce gözümüze Kaggle’dan bir görüntü verisi kestireceğiz. Modelimize uygun veriyi […]
GNU/Linux üzerinde Bash Komutları ile Veri Seti Keşfi ve Ön İşleme-1

Merhaba, Bugün sizlerle birlikte Ubuntu GNU/Linux üzerinde Bash komutları ile veri setini inceleme ve bazı önişleme süreçlerini birlikte gerçekleştiriyor olacağız. Ama önce; GNU (GNU Not Unix) Richard Stallman 1983’de GNU projesini ilan etti. Amacı tamamen açık kaynak kodlu bir UNIX (işletim sistemi) oluşturmaktı. Çalışmalar 1984 yılında başladı. 1990’da çekirdek hariç neredeyse her şey hazırdı. GNU’nun […]
SQL Sorgularının Python Pandas Dataframe Karşılıkları-3 (UPDATE, DELETE)

Merhaba serimizin üçüncü yazısında SQL update ve delete operasyonlarını pandas ile nasıl yaparız onu göreceğiz. Veri kaynaklarına ilk yazımızdan ulaşabilirsiniz. 1. UPDATE Verimizde bazı satırlarda meslek bilgisi boştu gelin onu güncelleyerek dolduralım. SQL UPDATE operasyonu tehlikeli bir iştir. Şayet filtreyi iyi ayarlamaz iseniz istenmeyen yerleri istenmeyen bilgilerle değiştirirsiniz. O yüzden ben UPDATE sorgusunda kullanacağım filtreyi […]
SQL Sorgularının Python Pandas Dataframe Karşılıkları-2 (GROUP BY, ORDER BY)

Merhabalar. Yaygın kullanılan SQL sorgularının Python pandas dataframe karşılıklarını bir örnek üzerinden paylaşmaya devam ediyoruz. Serimizin ilki olan bir önceki yazımızda SELECT ve WHERE cümlecikleri ile ilgili örnek yapmıştık. Bu yazıda kullanılacak veri kaynaklarına (sql ve pandas) ulaşmak için lütfen ilk yazıya müracaat ediniz. 1. GROUP BY GROUP BY özellikle veri keşfinde çok sık kullanılan […]
SQL Sorgularının Python Pandas Dataframe Karşılıkları (PANDAS SQL)-1 (SELECT, WHERE)

Merhabalar. Bu yazımızda yaygın kullanılan SQL sorgularının Python pandas dataframe karşılıklarını (Pandas SQL) bir örnek üzerinden paylaşmaya çalışacağım. Veri biliminin en zor ve meşakkatli aşaması veri hazırlığıdır. Hem SQL hem de pandas kendi alanlarında veri hazırlığında çok önemli rol oynarlar. Eğer bu ikisinden birini çok iyi bilmiyorsanız (Pythonistler için söylüyorum, sql yanındaki python değil R, […]
Feature Selection

Univariate Selection İstatistiksel testler ile bağımsız değişkenlerin bağımlı değişken ile güçlü ilişkileri ortaya çıkartılabilir. Örneğin, ki-kare testi ile değişkenlerin önem skorları bulunabilir. Ayrıca Veri Görselleştirme ile özellik seçimine yardımcı olunabilir. Feature Importance Feature Importance skorları hesaplanır. Correlation Matrix ve Heatmap Korelasyonu ve ısı haritasını kullanarak önemli değişkenler bulunabilir. Feature Selection Metotları Filter Methods […]
LSTM Ağları ile Yeni Nirvana Şarkısı Bestelemek

Merhabalar, bugünkü yazımda sizlere LSTM Ağları ile nasıl şarkı besteleyip, bunu selenium adlı kütüphane ile canlı olarak çalabileceğimizden bahsedeceğim. Yazının içeriği şu şekilde; LSTM Ağları Nedir? Selenium Nedir? Pythonda Keyboard ve Pynput Kütüphaneleri? Next Character Prediction Nedir? LSTM ile Şarkı Bestelemek Nota Verilerinin Alınması Verilerin İşlenmesi X ve Y’lerinin Belirlenmesi Verinin Model için Hazırlanması Modelin […]
Apache Spark ile Parquet Formatında Veri Yazma ve Okuma (Scala)

Merhaba. Bu yazımızda Apache Spark ile csv uzantılı bir veri dosyasını okuyup parquet uzantılı olarak diske kaydedeceğiz ve kaydettiğimiz parquet dosyasını tekrar Spark ile okuyacağız. Spark, birçok formatta veriyi okuyup yazabiliyor. Parquet, csv dosyalarına göre daha az yer kapladığı gibi okuma performansı da daha yüksek. Ayrıca okuma yaparken inferSchema veya header gibi ilave seçenekler kullanmıyoruz. Bu bilgiyi parquet formatından […]
Python Pandas float_format

Merhaba. Pandas dataframe çıktılarını incelemek için çoğu zaman df.head() metodunu kullanırız. Ancak bazen ondlıklı sayıların gösteriminde noktadan sonra çok fazla rakam olur ve bu çıktının okunup anlaşılmasını güçleştirir. Daha basit ve sade bir çıktı için ondalıklı sayıları formatlayabiliriz. Bu yazımızla bununla ilgili basit bir örnek yapacağız. Basit bir pandas dataframe oluşturalım: Yukarıdaki dataframe içinde noktadan […]
Python Pandas ile Aynı Anda Birden Fazla Excel Dosyasını Okumak

Dosya veri kaynakları arasında csv uzantılı dosyalar kadar excel dosyaları da bulunmaktadır. Pandas kütüphanesi her ne kadar bize bir .xls veya .xlsx uzantılı excel dosyalarını okumamıza imkan tanısa da bir dizin içinde birden fazla excel dosyasını okumak gerektiğinde iş bu kadar basit olmuyor. Birden çok excel dosyasını aşağıdaki gibi okuyabiliriz. yukarıda all_data ile her for […]