Ana içeriğe atla

Veri Bilimi Okulu

R ile Borsa Teknik Analizi

R programı ile Hisse Senetleri Üzerine Teknik Analiz Uygulaması Utku Kubilay ÇINAR Bu yazımda sizlerle borsada Teknik Analiz yapabileceğiniz bir kütüphaneyi (“quantmod“) sizlerle paylaşıp, tanıtımını yapmak istiyorum.   Bildiğiniz üzere borsada 2 farklı temele dayanan çeşitli analizler vardır. Bunlardan biri Temel Analiz, diğeri ise Teknik Analizdir. Temel Analiz; Şirketlerin bilançoları üzerinden varlıkları, Ana Ortaklık Karları […]

HDP-Sandbox içinde YARN’a Daha Fazla Kaynak Tahsis Etmek

Merhabalar. Bu yazımızda Hortonworks’ün Hadoop sürümü olan HDP 2.6.4 Sandbox üzerinde YARN’a daha fazla kaynağı nasıl tahsis edeceğimizi göreceğiz. Bu yazımızın amacı Sandbox ile uygulama yaparken en fazla bir YARN uygulaması çalıştırabilecek kadar kısıtlı kaynağa (özellikle de RAM) sahip omasıdır. Örneğin Sandbox’ın varsayılan ayarlarında YARN belleği 3000 MB ayrılmış. Biz bu kısıtlı kaynak ile hemSpark […]

Apache Spark ile Parquet Formatında Veri Okuma (Python)

Merhaba bu yazımızda parquet uzantılı bir dosyanın pyspark ile nasıl okunacağını göreceğiz. Bu yazıyı yazmamızın sebebi pyspark ile parquet dosyası okumanın, standart dataframe API’si ile csv gibi yaygın formatları okumaktan farklılık göstermesidir. Bu çalışma esnasında kullandığım ortamlar: İşletim sistemi: Windows 10 64 bit Pro IDE: Jupyter Notebook (Anaconda ile kuruldu) Spark 2.3.1 Dil: Python 3 […]

Apache Spark ile Parquet Formatında Veri Yazma ve Okuma (Scala)

Merhaba. Bu yazımızda Apache Spark ile csv uzantılı bir veri dosyasını okuyup parquet uzantılı olarak diske kaydedeceğiz ve kaydettiğimiz parquet dosyasını tekrar Spark ile okuyacağız. Spark, birçok formatta veriyi okuyup yazabiliyor. Parquet, csv dosyalarına göre daha az yer kapladığı gibi okuma performansı da daha yüksek. Ayrıca okuma yaparken inferSchema veya header gibi ilave seçenekler kullanmıyoruz. Bu bilgiyi parquet formatından […]

Python Pandas float_format

Merhaba. Pandas dataframe çıktılarını incelemek için çoğu zaman df.head() metodunu kullanırız. Ancak bazen ondlıklı sayıların gösteriminde noktadan sonra çok fazla rakam olur ve bu çıktının okunup anlaşılmasını güçleştirir. Daha basit ve sade bir çıktı için ondalıklı sayıları formatlayabiliriz. Bu yazımızla bununla ilgili basit bir örnek yapacağız. Basit bir pandas dataframe oluşturalım: Yukarıdaki dataframe içinde noktadan […]

Python Pandas ile Aynı Anda Birden Fazla Excel Dosyasını Okumak

Dosya veri kaynakları arasında csv uzantılı dosyalar kadar excel dosyaları da bulunmaktadır. Pandas kütüphanesi her ne kadar bize bir .xls veya .xlsx uzantılı excel dosyalarını okumamıza imkan tanısa da bir dizin içinde birden fazla excel dosyasını okumak gerektiğinde iş bu kadar basit olmuyor. Birden çok excel dosyasını aşağıdaki gibi okuyabiliriz. yukarıda all_data ile her for […]

Python ve Poisson Dağılımı ile Deprem Olasılığı Hesaplaması

Herkese merhabalar! Eğer üniversitede istatistik bölümü okuduysanız, olasılık dağılımları işlenirken verilen örnekleri az çok hatırlıyorsunuzdur. Bu örnekler yıldan yıla hiç değişmez. Bernoulli denemesi mi anlatılılır, hemen “Bir torbada 5 siyah, 7 siyah top vardır. Torbadan rastgele seçilen bir topun siyah olma olasılığı nedir?” örneği verilir. Bu örnekleri çoğaltabiliriz ama burada hepsini yazmayacağım. Benim asıl üstünde […]

R ile Zaman Serileri Çözümlemesi Bölüm 3 (Ayrıştırma Yöntemleri)

Merhaba Veri Bilimi Okulu sevenler bu yazımızda zaman serisi modellerinden olan Ayrıştırma Yöntemlerinden bahsedeceğiz. Bir zaman serisi trent(Tt), mevsimsel dalgalanma(Mt), döngüsel hareket (Ct) ve düzensiz rasgele hareketlere sahip hata bileşenlerinden (εt) oluşmaktadır. Bu bileşenleri ayırarak her bir bileşen için tahminleri içeren ve bu bileşenlerin tahmininden zaman serisinin öngörüsünü hesaplayan yönteme ayrıştırma yöntemleri denir. Matematiksel olarak,  Zt=f(Tt, Mt […]

Spark Dataframe İçindeki Kategorik Nitelikleri Otomatik Olarak Seçmek

Merhaba. Spark dataframe ile çalışırken zaman zaman içindeki kategorik değişkenleri seçeriz. Özellikle makine öğrenmesi öncesinde veri hazırlığı aşamasında bunu mutlaka yapmalıyız. Çünkü kategorik nitelikler veri hazırlığı sürecinde stringIndexer, OneHotEncoder gibi daha farklı aşamalardan geçer. Bu yazımızda Spark dataframe içindeki nitelikleri kategorik ve nümerik olarak ayırt eden ve iki farklı liste içinde bunları toplayan spark kodlarını yazacağız. […]

Apache Spark DataFrame İçinden Değerlere Ulaşmak

Merhabalar. Bu yazımızda Apache Spark Dataframe içindeki tekil bir değeri basit veri türünde (Int, Double vb.) nasıl elde edeceğimizi bir örnek ile göreceğiz. Benim yaptığım çalışma esnasında kullandığım ortam bilgileri: İşletim sistemi: Windows 10 64 bit Pro IDE: Intellij IDEA Community Edition Spark 2.3.1 Dil: Scala Kütüphaneler import org.apache.spark.sql.SparkSession import org.apache.log4j.{Logger, Level} Log Seviyesini ERROR […]

data.table Paketiyle Atom Karınca Hızıyla Verilerinizi İşleyin!

R’da SQL kafası yaşamak isteyenler buraya !!! Gruplama, alt küme, güncelleme ve birleştirme işlemlerini hızlı ve hafızaya uygun bir kodla sonuçlandırarak işlemleri çok etkili bir şekilde otomatik olarak optimize etmeye ne dersiniz? Herbir işlemi belirli potansiyel olarak dev bir fonksiyonla eşleştirmek zorunda kalmadan akıcı bir şekilde analiz yapmaya ne dersiniz? Özetle minimum sürede minimum kodla maksimum […]

İstihdam Oranının Modellenmesinde Zaman Serisi Modellerinin Kullanımı

Zaman serilerinin analizinin temelinde, serilerin özelliklerinin doğru şekilde belirlenmesi ve belirlenen özelliklere en uygun şekilde modelize edilmesi fikri yer almaktadır. Bu genel ifade de en önemli nokta “serilerin özelliklerinin doğru belirlenmesi”dir. Çünkü biliyoruz ki, “all models are wrong, but some are useful :)” (George E. P. Boz). Sadece bir zaman serisinin modelize edilmesi, bizi tek […]