Database, Datawarehouse, Datalake derken bir de Lakehouse mu çıktı başımıza?

Geçenlerde lakehouse kavramını duyunca Hoppalaaa!!! diyesim geldi. Neredeyse her güne yeni bir kavramla uyandığımız bir devirde yaşıyoruz. Daha datawarehouse ne anlayamadan başımıza datalake çıkardılar, şimdi ise lakehouse. Merak ettim, lakehouse da acaba aynı şeylerin süslenmiş başka isimlerle sunulması mı diye? Değilmiş. Bir veri mühendisi, veri bilimci veya veri analisti için bir veri akışı (data pipeline) […]
SQL Server Profiler

Bu yazıda SQL de bir sorgu çalıştırırken server da neler olduğunu izleyebileceğimiz SQL Server Profiler kullanmayı göreceğiz.
Pratik Bilgiler, Pratik Komutlar: Python Pandas

Merhabalar bu yazımızda Python Pandas ile pratik bilgiler ve komutları paylaşıyor olacağım. Pandas dataframe tarih (date) filtreleme Dataframe içinde takrarlanan sütunları elde etmek Bir sütunda birden fazla değer içinde arayarak filtrelemek: where a_column in () Pandas ile zip dosyasından veri okumak Python Pandas head Sütun Truncate Önleme – pandas truncate column Pandas dataframe sütunlarını tek […]
Google Bigquery ile Google Analytics Uygulamaları

Merhaba VBO okuyucuları! Bir önceki yazımda Google Bigquery hakkında temel bilgiler vermiş olup, yazının sonunda Google Analytics’e de değinmiştim. Bu yazımda Google Analytics datası üzerinde dijital pazarlama metriklerini Bigquery üzerinde kodlayarak göreceğiz. Google Analytics nedir? Kısaca, Google Analytics e-ticaret sitesi/ web sitesine gelen ziyaretçiler hakkında detaylı analizler yapabilmeyi sağlayan web analiz aracıdır. Örneğin, son 30 […]
Özellik Oluşumu ve Özellik Seçimi(Feature Selection)-2

Merhaba Arkadaşlar, Özellik seçimi ile ilgili yazı serisinin 2.yazısını okumaktasınız, eğer ilk yazıyı okumadıysanız ilk yazıyı okumanız konu bütünlüğünü anlamak adına faydanıza olacaktır. İlk yazıda temel temizlik ve bazı istatistiksel yöntemleri açıklamaya çalıştım. En basit yöntem olan tüm değişkenlerin tüm kombinasyonlarını kullanarak karar verme süreci çok uzun ve maliyetli bir işlem olduğunu söylemiştim. 1.yazıda anlattığımız […]
Risk Analitiği: R ile Hisse Senedi Verisi Üzerinde Value at Risk Uygulaması – I

Herkese merhabalar, Bu yazımda, “Riske Maruz Değer (Value at Risk – VaR) kavramı nedir? Bir portföyün, pozisyonun veya tek bir finansal varlığın risk ölçümü nasıl yapılır? Riske Maruz Değer kapsamında kullanılan istatistiksel yöntemler nelerdir?” gibi bir çok soruya cevap bulacağız. Uygulamayı R programlama dilinde yapacağız. #banvt ve #nthol hisse senedi fiyatlarına ait milisaniye cinsinden veriler […]
Evrişimli Sinir Ağlarıyla Haberlerin Sınıflandırılması

Merhabalar! Uzun bir aradan sonra yine sizlerleyim 🙂 Bu yazımda çoklu sınıflandırma problemini inceleyeceğiz. Bunun sebebi günümüzde sınıflandırma problemlerinin büyük bölümünün ikili değil çoklu sınıflandırma problemi olmasıdır. Çoklu sınıflandırma problemi temel olarak ikiye ayrılır. Tek etiketli ve çok etiketli olanlar. Çalışma kapsamında tek etiketli çoklu sınıflandırma problemi ele alınmıştır. Bu problem için farklı haber kategorisine […]
CatBoost Nedir? Diğer Boosting Algoritmalarından Farkı Nelerdir?

Catboost, Yandex şirketi tarafından geliştirilmiş olan Gradient Boosting tabanlı açık kaynak kodlu bir makine öğrenmesi algoritmasıdır. Gradient Boosting’in performansını arttırmak amacıyla geliştirilen XGBoost ve LightGBM’e alternatiftir.