Ana içeriğe atla

Veri Bilimi Okulu

R ile Metin Madenciliği | Bölüm 6/6

Bölüm 5/6’da düzenli yapıda olmayan metin verilerini, çeşitli araçlarla nasıl düzenli hale getirebileceğimizi öğrendik. Bu bölümde bahsi geçen dönüştürme araçlarının konu modellemesi üzerinde metin analizine katkısı anlatılacaktır. 6. Bölüm – Konu Modellemesi – Topic Modelling Metin madenciliğinde , döküman topluluklarını yani blog gönderileri veya haber makaleleri gibi metinleri anlayabilmek için doğal gruplara ayırmamız gerekir. Konu […]

R ile Metin Madenciliği | Bölüm 5/6

5. Bölüm – Düzenli Olmayan Veri Formatını Dönüştürme Önceki bölümlerde, unnest_tokens işlevi tarafından düzenli metin formatına getirilmiş metinleri analiz ettik. Ayrıca metin verilerini keşfetmek ve görselleştirmek için dplyr, tidyr ve ggplot2 gibi araçlar ile analizlerimizi zenginleştirdik. Yukarıdaki şema tipik bir metin analizinin akış şemasıdır. Bu bölümde döküman-terim matrisleri ve düzenli veri setleri arasında dönüştürme ve […]

R ile Metin Madenciliği | Bölüm 4/6

4. Bölüm – Kelimeler Arasındaki İlişkiler: n-gram ve Korelasyon Şuana kadar kelimeleri birer birim olarak ele aldık ve kelimelerin duygularını veya belgelerle olan ilişkilerine baktık. Bununla birlikte metin analizi aynı zamanda kelimeler arasındaki ilişkilere dayanır, hangi kelimelerin diğerlerini takip etme eğiliminde olduğunu veya aynı belgelerde birlikte olma eğilimini gösterir. Bu bölümde kelimeler arasındaki ilişkileri hesaplama […]

R ile Metin Madenciliği | Bölüm 3/6

Önceki yazılarda metin madenciliği üzerine genel girişi yaptığımıza göre yavaş yavaş işi ilerletme zamanı geldi, ama önceki konuda neler yaptığımızı hatırlayalım. Duygu analizinin ve duygu sözlüklerinin ne olduğunu, karşılaştırmalar ve görselleştirmeler üzerinden anlattık. Şimdi ise, belge koleksiyonlarından nasıl bilgi çıkarımı yapacağımızı keşfedelim. 3. Bölüm – Kelime ve Belge Sıklıklarını Analiz Etme: tf-idf Doğal Dil İşlemenin […]

R ile Metin Madenciliği | Bölüm 2/6

Önceki yazımız, Bölüm 1/6’da metin yapılarının ve düzenli metin formatının ne olduğundan bahsettik. Temel amacımız, tidytext kütüphanesi ile metinleri parçalamak ve kelime frekanslarını elde etmek. Bu yazı serisinde, tidytext kütüphanesi ile birlikte bolca dplyr ve ggplot2 kütüphaneleri kullanılacaktır. Bölüm 2/6’da ise bir metni anlamlandırmanın en kolay ve uygun yolu olan “Duygu Analizini” (sentiments analysis) öğreneceğiz. […]

R ile Metin Madenciliği | Bölüm 1/6

Bu uzun yazı serisi “Tidy Text Mining with R” kitabının derlenmesinden ortaya çıkmıştır. https://www.tidytextmining.com/ Her istatistiksel yöntem gibi temel amacımız, metin içerisinden anlamlı sonuçlar ortaya çıkarmaktır ve metin üzerinde yapılacak işlemlere de metin madenciliği adı verilir. Aşağıdaki kütüpaneler bu kitap içerisinde gerekli olan tüm kütüphanelerdir. library(dplyr) # Veri Manipülasyonu library(tidytext) # Düzenli Metin Araçları library(janeaustenr) […]