Eksik Veri – Kayıp Veride Kullanılabilecek Algoritmalar

Missing Value Imputation, Handling of the Missing Data in R Utku Kubilay ÇINAR Ne güzeldir hazır verilerle çalışmak. Eksik gözlem derdin yok, ilişkisel veri tabanlarından verilerini birleştirme çaban yok, gürültülü veri desen ona ne hacet. En sevdiğimiz veri, hazır – işlem gerektirmeyen ve direk analizlerimize başlayacağımız veri setleri olsa da hayatın acımasız gerçekleri […]
36 Subay Problemi

Bulmacalarla aranız nasıldır? Kare kutuların içine kimi zaman harf kimi zaman rakamları doldurduk. Bu bulmaca her ikisinden de içerebilir.Latin Kareleri duydunuz mu? Ya da onu duyduysanız Grekolatin Kareleri duydunuz mu? Eğer duymadıysanız ya da duydunuz ama ne olduğunu bilmiyorsanız buyrun bakalım. Özel bir matris türü olan Latin Kareler, kombinasyon tasarımlarında ve istatistikte yapılan deneylerde geniş […]
R ile Veri Manipülasyonu | Bölüm 3/3

En önemli bölümümüz birinci bölümdü. Temel prensipleri anladığımız taktirde işlemleri bir şekilde yapabiliriz, geri kalan kısım ise bu prensipleri uygulayacağımız kısımlardır. Burada çok detaya girmeden metin manipülasyonu için bazı fonksiyonları anlatacağız. Ardından ise eksik gözlem, aykırı gözlem ve bazı bariz hatalardan bahsedeceğiz. 5. Metin Manipülasyonu Verilerde metinler başlı başına bir problem bu yüzden yeri geldiğinde […]
R ile Veri Manipülasyonu | Bölüm 2/3

Veri Bilimi maceramızda bir önceki bölümde veri manipülasyonun öneminden ve prensiplerden bahsetmiştik. Bu bölümde ise dağınık veri setlerinden ve değişken dönüşümlerinden ve tarih formatından bahsedeceğiz. 3. Dağınık Verilerin Ortak Belirtileri Şuana kadar yaptıklarımızı kısaca örnekler üzerinde görelim. Sütun başlıkları birer değerdir, değişken ismi değildir! kisi_dirty ## kisi cinsiyet ela mavi yesil boy yas ## 1 […]
R ile Veri Manipülasyonu | Bölüm 1/3

Elimizde her zaman iyi bir veri seti olmayacaktır. Özellikle bazı veriler için uzun ve yorucu veri manipülasyonları yapıldıktan sonra analiz, modelleme ve görselleştirme aşamasına geçilecektir. Bu yüzden veri manipülasyonu ve tidy data (düzenli veri) formatının veri bilimci adayları tarafından iyi bir şekilde benimsenmesi gerekiyor. Dirty Data İşte mükemmel olmayan bir veri seti karşınızda ! weather […]
R ile Veri Manipülasyonu: Uygulama

Elimizde tarihsel Boston hava durumu verisi var. 2014 Aralık’tan başlayarak 12 aylık bir veri, Dirty Data formatında, Sütun isimleri birer değer, Değişkenler yanlış kodlanmış, Eksik ve Aykırı gözlemlerimiz bulunmakta, ve daha nice problemler. AMACIMIZ: Veriyi analiz edebileceğimiz bir formata çevirmek. Veri manipülasyonu için üç aşamayı takip edeceğiz. Ham verileri keşfetmek Düzenli veri formatı – Tidy data […]
Kovaryans Matrisi (Covariance Matrix) Nedir?

Kovaryans iki değişken arasındaki doğrusal ilişkinin değişkenliğini ölçen bir kavramdır. Betimsel istatistiktir. Yani var olan bir şeyi bize söyler. Ortada tahmin yoktur. Sonucun pozitif olması artan bir doğrusal ilişkiyi, negatif olması azalan bir doğrusal ilişkiyi ve sıfır civarında olması ilişkinin olmadığını gösterir. Kovaryans matrisi ise bu değişkenlerin karşılıklı kovaryans değerlerinin bulunduğu bir matristir. Aşağıda örnek […]
Python ile Makine Öğrenmesine Giriş Pandas Kütüphanesi

Merhabalar, Makine Öğrenmesine Giriş Serisi’nin İlk kütüphanesi Pandas’tan bahsedeceğim bu gün, serinin devamında numpy, matplotlib, scikit-learn vs. gibi kütüphanelerden bahsedip ardından önce basit örneklerden başlayıp daha komplike örnekler ile python’da makine öğrenmesini anlatacağım. Şimdiden İyi Okumalar! Pandas Nedir? Pandas genelde veri işleme ve temizlemede oldukça efektif şekilde kullanılan, hatta makine öğrenmesi gibi alanlarda oldukça fazla […]
Süreç Madenciliği Uygulamalarının İşinizi Geliştirmenizi Sağlayabileceği 5 Özelliği

Zamandan tasarruf ve işin çıktılarına odaklanabilmek Soru: Süreçlerinizin analizi için 10 tane yeni eleman işe alır mıydınız? Cevap: Hayır. Bunu herkes yapabilir. Altyapı yerinde olduğunda, içerik deposunu etkinleştirebilir ve bağlayıcıları ve uygulamaları indirebilir ve uygulayabilirsiniz. İşte etkin rol alan kullanıcılar ve süreçlerin asıl sahipleri bu uygulamalarla ve araçlarla verileri hakkında gerçek zamanlı bir fikir elde edebilirler. […]
Süreç Madenciliği: Vodafone

2016 Yılında dünyanın en büyük telekom sağlayıcılarından biri olan Vodafone, tedarik departmanını dünya çapında bir satın alma kuruluşuna dönüştürmek için çalışma yürütmeye karar verdi. Sadece altı ay sonra ekip, Hackett Grouop’un dünya standardını aşan mükemmel bir satın alma emri (PO-Purchase Order) oranı ile hedeflerini aştılar. O zamandan bu yana bölüm şaşırtıcı bir şekilde %92 Oranında […]
Bir Süreç Madenciliği Aracı: DISCO

DISCO Nedir? DISCO, Fluxicon’un bir projesi olarak süreç madenciliği alanı için geliştirilen otomatize araçtır. DISCO projesinin hayata geçmesini sağlayan DR. Anne Rozinat ve DR. Christian W.Günther DISCO yazılımını “Ham verilerden işleminiz hakkında 5 dakikadan daha kısa sürede görsel ve kullanılabilir bilgiler sunu” mottosu ile geliştirmiş ve piyasaya sürmüştür. DISCO Süreç madenciliği çalışmalarının kısa sürede daha […]
Seaborn ile Veri Görselleştirmesi

Klasik formatta sunulan verileri anlamak her zaman insana zor gelir. Bu yüzden veri görselleştirmesi kullanarak daha veriden elde ettiğimiz sonuçları daha anlaşılır hale getiriyoruz. Python ile veri görselleştirmesi yaparken genel olarak kullanılan kütüphane Matplotlib kütüphanesidir. Ama genelde Matplotlib ile görselleştirme yapan herkes “neden adam akıllı bir grafik yapmak için 5-10 satır kod yazmak zorunda kalıyorum?” […]
Apache Spark ile Artık İdeal Küme Sayısını Bulmak Daha Kolay

Bildiğimiz gibi makine öğrenmesinde öğrenme yöntemleri genel olarak denetimli (supervised) ve denetimsiz (unsupervised) şeklinde ikiye ayrılıyor. Denetimli yöntemlerde sınıflandırma ağırlık kazanırken denetimsiz yöntemlerde ise kümeleme öne çıkmaktadır. Sınıflandırmada veri içinde etiketlenmiş bir hedef değişken bulunurken kümelemede ise herhangi bir hedef değişken bulunmaz. Bu nedenle kümeleme daha çok veri içindeki nesnelerin doğal gruplanmalarını ortaya çıkarmaya yöneliktir. […]
Süreç Madenciliğine Giriş

Herkese merhaba, bu benim VBO bünyesinde ki ilk blog yazımdır. Bu zamana kadar hep akademik makale disiplininde yazdığım için lütfen ciddiyetimi mazur görün. 😊 Henüz daha “Büyük veri nedir, veri madenciliği nedir ne işe yarar”ı yeni yeni sindirirken bir de karşınıza süreç madenciliği diye bir kavram çıkardım ki bu disiplin hepsinden faydalanmaktadır. 😊 Bana süreç […]
Yapay Sinir Ağları

Yapay Sinir Ağları ve R Programıyla Uygulama Artificial Neural Network Utku Kubilay ÇINAR Yapay sinir ağları (YSA), insan beyninden esinlenerek geliştirilen ve günümüzde kodlama dünyasında sıklıkla kullanılan bir algoritmadır. Bir yapay sinir ağı, yapay sinir hücreleri arasında çeşitli bağlantılarla oluşur. Oluşan bu bağlantılar arasında önem (ağırlık ya da insan beynindeki “sinapslar”) vererek sonuca ulaşmayı […]
Laplace’ın Şeytanı Teoremi

Duyanlarınız olmuştur Laplace’ın Şeytanı Teoremini elbette duymayanlar ve duyanlar için de bazı gözden kaçanlar olabilir diye sizi okumaya davet ediyorum. Nedir bu Laplace ’ın Şeytanı Teoremi ? Buyrun beraber bakalım. Bu konuyu seçme sebebim Adam Fawer’ ın Olasılıksız adlı kitabını okumam ve bu kitapta beni en çok etkileyen konunun bu olmasıdır. Belki kitapta fazla değinmesede […]
R ile Metin Madenciliği | Bölüm 6/6

Bölüm 5/6’da düzenli yapıda olmayan metin verilerini, çeşitli araçlarla nasıl düzenli hale getirebileceğimizi öğrendik. Bu bölümde bahsi geçen dönüştürme araçlarının konu modellemesi üzerinde metin analizine katkısı anlatılacaktır. 6. Bölüm – Konu Modellemesi – Topic Modelling Metin madenciliğinde , döküman topluluklarını yani blog gönderileri veya haber makaleleri gibi metinleri anlayabilmek için doğal gruplara ayırmamız gerekir. Konu […]
R ile Metin Madenciliği | Bölüm 5/6

5. Bölüm – Düzenli Olmayan Veri Formatını Dönüştürme Önceki bölümlerde, unnest_tokens işlevi tarafından düzenli metin formatına getirilmiş metinleri analiz ettik. Ayrıca metin verilerini keşfetmek ve görselleştirmek için dplyr, tidyr ve ggplot2 gibi araçlar ile analizlerimizi zenginleştirdik. Yukarıdaki şema tipik bir metin analizinin akış şemasıdır. Bu bölümde döküman-terim matrisleri ve düzenli veri setleri arasında dönüştürme ve […]
R ile Metin Madenciliği | Bölüm 4/6

4. Bölüm – Kelimeler Arasındaki İlişkiler: n-gram ve Korelasyon Şuana kadar kelimeleri birer birim olarak ele aldık ve kelimelerin duygularını veya belgelerle olan ilişkilerine baktık. Bununla birlikte metin analizi aynı zamanda kelimeler arasındaki ilişkilere dayanır, hangi kelimelerin diğerlerini takip etme eğiliminde olduğunu veya aynı belgelerde birlikte olma eğilimini gösterir. Bu bölümde kelimeler arasındaki ilişkileri hesaplama […]
R ile Metin Madenciliği | Bölüm 3/6

Önceki yazılarda metin madenciliği üzerine genel girişi yaptığımıza göre yavaş yavaş işi ilerletme zamanı geldi, ama önceki konuda neler yaptığımızı hatırlayalım. Duygu analizinin ve duygu sözlüklerinin ne olduğunu, karşılaştırmalar ve görselleştirmeler üzerinden anlattık. Şimdi ise, belge koleksiyonlarından nasıl bilgi çıkarımı yapacağımızı keşfedelim. 3. Bölüm – Kelime ve Belge Sıklıklarını Analiz Etme: tf-idf Doğal Dil İşlemenin […]