Ansible ile Trino Cluster Kurulumu

Ansible ile Trino: Kolayca Dağıtım Yapın! Modern veri analiz araçlarından biri olan Trino, dağıtılmış sorgulama yetenekleri ile büyük veri kümeleri üzerinde performanslı işlemler sunar. Bu yazımızda, Ansible kullanarak Trino’yu bir koordinatör ve üç worker mimarisiyle nasıl kuracağınızı göstereceğim. Yazımızda Neler Yapacağız? Bu yazıda, Ansible’ı kullanarak sanal makineler üzerinde otomasyon yapacağız. Aşağıdaki adımları takip edeceğiz: Sanal […]

Docker ve Kubernetes Kurulumu: VirtualBox+CenOS7+Docker+Minikube

Herkese merhaba. Bu yazımda eğitim veya geliştirme amaçlı Docker ve Kubernetes (Minikube) ortamını nasıl kuracağımızdan bahsedeceğim. Peşinen söyleyeyim ki Kubernetes değil, üzerinde Kubernetes kullanabileceğimiz Minikube kuracağız. Konteynırlaşma trendi artarak devam ediyor. Yakın bir zamanda “Hala Docker bilmiyor musun? Cahil misin nesin?” muhabbetiyle karşılaşabilirsiniz. Sadece Docker olsa iyi bir de bunun Kubernetes’i var. Elbette bir çok […]

Kendi Knime Eklentinizi Oluşturma Rehberi: Node İşlevinin Kodlanması [3. Bölüm]

Merhaba, Kendi Knime Eklentinizi Oluşturma Rehberi serimin son bölümüne ulaştık. Daha önceki bölümlerde geliştirme ortamının hazırlanmasından ve geliştirmekte olduğumuz nodun arayüzünü oluşturmaktan bahsetmiştik. Bu bölümde ise oluşturduğumuz nodun işlevini kodlayacağız. Bir önceki bölümden hatırlayacağınız gibi iki sütunda yer alan bir ve sıfır değerleri arasında “VE”, “VEYA” mantıksal işlemlerini yapabilen ve sonuçlarını üçüncü bir sütuna yazabilen […]

Kendi Knime Eklentinizi Oluşturma Rehberi: Node Diyaloğunun Oluşturulması [2. Bölüm]

Kendi Knime Eklentinizi Oluşturma Rehberi serisinin ikinci yazısında tekrar birlikteyiz. Bir önceki yazıda geliştirme ortamını hazırlamıştık. Bu yazıda ise işin görsel tarafı olan diyalog penceresini tasarlayıp implemente edeceğiz. Bu uygulamada “ve”, “veya” gibi mantıksal işlemleri yapabilecek örnek bir node oluşturacağız. Daha açık anlatmak gerekirse aşağıdaki tabloya, örneğin “ve” mantıksal işlemini yaptığımızda… Sonuç aşağıdaki gibi olacaktır. […]

Kendi Knime Eklentinizi Oluşturma Rehberi: Geliştirme Ortamının Hazırlanması

Merhaba, daha önceki yazılarımda Knime ile bir sınıflandırma uygulaması yapmıştık daha sonra yine Knime ile oluşturulan modelin farklı programlama dillerinde nasıl kullanılabileceği ile ilgili bir uygulama yapmıştık. Bu yazımda ise Knime ile mümkün olan bir başka konuya değineceğim. Knime içerisinde ETL’den ML ve DL’e kadar birçok önyüklü özellik bulunmakta. Eğer bu özelliklerden daha fazlasına ihtiyaç […]

Python Virtual Environment Nedir?

virtual environment

Yeni bir yazı ile herkese merhaba! Bugün size karşılaştığım bir problemden bahsedeceğim. Python ile veri bilimi projeleri yaparken paket dağıtımı olarak Anaconda kullanıyordum. Çünkü Anaconda, çok fazla Python ve R paketini bünyesinde bulunduran bir paket dağıtımıdır. Karşılaştığım sorun ise tam olarak burada başlıyor. Anaconda’yı bilgisayarınıza yüklediğiniz zaman o kadar çok paket yüklüyor ki bir süre […]

Python Mongodb: Pandas Dataframe’i MongoDB’ye Yazmak

Merhabalar bu yazımızda Python Mongodb entegrasyonunu yapıp Python Pandas Dataframe verisini Python kullanarak MongoDB’ye yazacağız. MongoDB ile etkileşime geçmek için çok farklı dillere ait driver paketler yazılmış. Bu dillerden birisi de Python. Bu yazımızda Python’ın pymongo kütüphanesini kullanacağız. Bu kütüphane Python diliyle MongoDB’de bir şeyler yapmak isteyenler için yegane çözüm. Bu yazıyı takip etmek için […]

Python ile Veri Bilimi Çalışma Ortamı Kurmak (Python Jupyter ve Paket Kurulumu)

Merhaba bu yazımızda veri bilimine yeni başlayanlar için başlangıç çalışma ortamını oluşturacağız. Amacımız python jupyter notebook kullanabilmek ve numpy, pandas, sklearn ve matplotlib gibi temel paketleri yüklemek. 1. Python yüklemek Python şuan 3.7.X sürümünde ancak ben biraz geriden takip etmenizi ve daha kararlı sürüm olan 3.6.X’i kullanmanızı öneriyorum. Kendim 3.6.8 kullanıyorum, bu yazıda da bu […]

IntelliJ IDEA ile Apache Spark Projesini Uzak YARN Cluster Üzerinde Çalıştırmak-1/2

1. Giriş Merhabalar. Uygulama geliştirirken geliştirme(dev), test ve canlı (prod) gibi farklı farklı ortamlar kullanırız. Farklı ortamlarda çalışırken bazı ayarlamalar yapmamız gerekir. Şayet hızlı bir şekilde uygulamayı çıkarayım, geliştirme, canlı vb. uğraşmayayım diyorsanız bu yazı size göre. Bu yazıda Windows bilgisayarımızı driver olarak kullanarak IntelliJ IDEA ile canlı Hadoop Cluster üzerinde kodlarımızı geliştirme esnasında çalıştıracağız. […]

IntelliJ IDEA ile Apache Spark Projesini Uzak YARN Cluster Üzerinde Çalıştırmak-2/2

Merhaba. Yazı serimizin ikincisine devam ediyoruz. Bir önceki ilk yazımızda konuya giriş yapmıştık. Hatırlayalım, amacımız Spark uygulamasını Windows bilgisayarımızda kurulu IntelliJ ile uzak hadoop cluster üzerinde geliştirmekti. IntelliJ ile devam ediyoruz. 4. IntelliJ Spark Uygulaması: Maven Projesi Oluşturmak Şimdi uygulamamızı yazmaya başlayacağız. Bunun için IntelliJ’i başlatalım. Intellij üzerinden yeni proje (Create New Project) diyoruz. Bir […]

R ile Veri Tabanına Bağlanmak: SQL Server ve ODBC Örneği

R dili istatistiksel hesaplamalar ve veri görselleştirmesine imkan veren açık kaynaklı ücretsiz bir dildir. R dilinin arkasında güçlü bir topluluk (community) bulunmaktadır. Son yıllarda sadece istatistikçiler ve akademisyenler değil veri bilimcileri arasında da oldukça popülerlik kazanmış bir dildir. Bir veri bilimi ekibinin üzerinde çalışmak istediği veri seti genellikle ilişkisel veri tabanlarında saklanmaktadır. Eğer bu veriler […]