Çalışmanın asıl amacı yalnızca en yakın noktayı bulmak değildi. Gürültülü adres metinlerini normalize edip koordinata dönüştürmek, coğrafi kümeyi belirlemek ve o küme içinde anlamlı bir label tahmini üretmekti.
VERİ DARALTMA HUNİSİ
01 / HAM GİRDİDağınık adres metinleri
Serbest yazım, farklı kısaltmalar, tekrarlanan konum ifadeleri ve tahmini zorlaştıran ayrıntılar aynı veri havuzunda bulunuyordu.
02 / NORMALİZASYONOrtak bir adres dili
Türkçe karakterler, noktalama, boşluklar ve adres bileşenleri standartlaştırılarak aynı yeri anlatan farklı yazımlar yakınlaştırıldı.
03 / COĞRAFİ FİLTREDoğrulanmış bölgesel alt küme
Koordinatı çözülebilen kayıtlar kontrol edildi; çalışma alanıyla ilişkili noktalar seçilerek gürültü ve kapsam dışı kayıtlar ayrıldı.
04 / MODEL GİRDİSİKonum ve hedef sinyali
Enlem, boylam ve label ilişkisi modellemeye taşındı. Cluster ise veride hazır gelen değil, analiz sırasında üretilen bir bölge katmanıydı.
Buradaki asıl hikâye kayıt sayısı değil, ham metnin güvenilir bir coğrafi sinyale dönüşmesidir. Gizli satırlar ve gerçek adres örnekleri yayınlanmaz.
A / VERİ
Model hangi sinyalleri kullanıyordu?
Temel kayıt yapısı; serbest biçimli adres metni, hedef label, enlem ve boylam alanlarından oluşuyordu. Adres metni geocode öncesinde Türkçe karakter, kısaltma, noktalama, kat ve daire gibi parçalar için normalize ediliyordu.
adres metni
latitude
longitude
label
cluster
B / MODEL
Neden iki aşamalı bir tahmin?
İlk aşama koordinatları geniş coğrafi bölgelere ayırarak arama uzayını anlamlı parçalara bölüyordu. Yeni bir nokta, ölçeklenmiş uzayda en yakın bölge merkezine atanıyor; ikinci aşamadaki mesafe ağırlıklı KNN ise daha yerel label tahminini üretiyordu.
Bu sayı evrensel bir doğru olarak seçilmedi. Farklı kümeleme yaklaşımları ve bölge sayıları karşılaştırıldı; coğrafi ayrışmayı okunabilir tutan, çok küçük ve dengesiz bölgeleri sınırlayan deneysel bir çalışma noktası olarak kullanıldı.
DendrogramDoğal birleşme seviyeleri ve bölge hiyerarşisi okundu.
SilhouetteKümelerin kendi içinde yakın, birbirinden ayrık kalması izlendi.
DengeAşırı büyük veya çok küçük kümelerin analizi bozması kontrol edildi.
KontrolWard yaklaşımıyla bölge sayısı ve sonuçların yorumlanabilirliği korundu.
01Normalize et
Türkçe büyük/küçük harfleri, adres kısaltmalarını ve gürültülü işaretleri standartlaştır.
Noktayı ölçekle, 20 merkezle karşılaştır ve en yakın coğrafi cluster’ı belirle.
04Label tahmin et
Yedi komşunun uzaklıklarını ağırlıklandır; label, olasılık ve komşuluk mesafelerini üret.
05Kapsamı gör
Cluster ve label noktalarından merkez, yaklaşık yarıçap ve nokta sayısı çıkarıp haritada katmanlaştır.
D / DENEYLER
Model karşılaştırması
Deneyler yalnızca “hangi algoritma daha iyi?” sorusuna bakmıyordu. Metin ile koordinatın problemi ne kadar farklı temsil ettiğini de gösteriyordu.
YaklaşımSinyalDeneyden çıkan okuma
KNNKoordinat
Fiziksel yakınlığı doğrudan taşıdığı için en güçlü yerel sinyali verdi ve ikinci aşama için seçildi.
Naive BayesTF-IDF metin
Hızlı bir referans noktası sağladı; birbirine benzeyen çok sayıdaki label arasında ayrım gücü sınırlı kaldı.
Logistic RegressionTF-IDF metin
Yorumlanabilir doğrusal bir temel sundu; yakın sınıfların kelime uzayındaki sınırlarını tek başına ayırmakta zorlandı.
Random ForestTF-IDF + SVD
Doğrusal olmayan ilişkileri denedi; metni yoğun temsile indirgemek bazı seyrek adres sinyallerini kaybettirdi.
Decision TreeTF-IDF metin
Basit bir karşılaştırma modeli oldu; yüksek boyutlu metin uzayında kararlı bir genelleme üretmedi.
E / PUBLIC ÖDEV PAKETİ
Kod, notebook ve sentetik veri birlikte.
Gerçek adres satırları paylaşılmadan ödevin nasıl çalıştığı incelenebilir. Public paket; normalizasyonu, Ward tarzı kümelemeyi, en yakın merkez atamasını ve mesafe ağırlıklı KNN akışını küçük bir sentetik veri üzerinde yeniden üretir.