AgubuBebek bakım asistanı English

Bebek ağlama sesi analizi doğruluk: ne ölçtük, ne bulduk

Bebek ağlama sesi analizi doğruluk sorusuna bir yüzdeyle değil, ölçümle cevap veriyoruz. Kısa cevap: ağlama sesi bebeğin kim olduğunu ve kaç aylık olduğunu taşıyor, neden ağladığını taşımıyor. Bu sayfa ne ölçtüğümüzü, hangi sayıları bulduğumuzu, yüksek yüzdeli iddiaların nereden çıktığını ve Agubu'nun bu yüzden ne yaptığını anlatıyor.

Buradaki her sayı kendi ölçümümüzden ya da adı verilen yayından geliyor. Aynı sayfa uygulamanın içinde Ayarlar → Bu uygulama nasıl karar veriyor? yolunda duruyor ve hiçbir zaman kilitlenmeyecek.

Ne ölçtük

Ticari kullanıma açık, neden etiketli tek herkese açık veri seti olan donateacry-corpus üzerinde çalıştık: 457 kayıt, 221 farklı bebek. Her kayıttan YAMNet ses gömülerini çıkardık ve aynı sınıflandırıcıya üç ayrı soru sorduk: bu klip hangi bebekten, bebek kaç aylık, bebek neden ağlıyor.

Bölmeyi bebek bazlı yaptık: bir bebeğin kayıtları ya eğitimde ya testte, ikisinde birden değil. Bu ayrıntı her şeyi belirliyor; aynı bebek iki tarafta birden olursa model soruyu değil bebeği öğreniyor ve sonuç şişiyor.

Ana ölçütümüz dengeli doğruluk, ham doğruluk değil. Sebebi şu: veri setindeki kayıtların %83,6'sı “aç” etiketli. Hiçbir şey öğrenmeyip her seferinde “aç” diyen boş bir model ham doğrulukta %83,6 alır.

Sonuç tablosu

Aynı veri, aynı gömüler, aynı sınıflandırıcı, aynı bebek bazlı çapraz doğrulama. Şans düzeyi parantez içinde:

  • Kimlik — “bu klip hangi bebekten?” → %62,5 (şans %9,1). Kazanç +53,4 puan.
  • Yaş — yenidoğan / bebek / büyük → %40,2 (şans %33,3). Kazanç +6,9 puan.
  • Neden — 3 sınıf → %32,9 (şans %33,3). Kazanç −0,4 puan.
  • Neden — aç / değil → %49,2 (şans %50,0). Kazanç −0,8 puan.
  • Neden — acı / diğer → %51,0 (şans %50,0). Kazanç +1,0 puan.

Okuma

Boru hattı çalışıyor: bireysel bebekleri sesinden şansın çok üstünde ayırt edebiliyor, yaşı da tahmin edebiliyor. Aynı boru hattı, aynı veriyle, nedeni hiç bulamıyor. Sorun yöntemde değil; bilgi seste yok.

Bu bulgu yalnız bize ait değil

Lockhart-Bouron ve arkadaşlarının Communications Psychology dergisinde 2023'te yayımladığı çalışma, 24 bebeğin evlerinde kaydedilmiş 39.201 ağlama dizisini inceledi. Nedeni bilinen 676 klip üzerinde ne yetişkin dinleyiciler ne de ağlamayı durduran ebeveyn eylemiyle eğitilmiş bir algoritma nedeni güvenilir biçimde sınıflandırabildi; buna karşılık yaş ve kimlik güvenilir biçimde taşınıyordu. Kaynak: Communications Psychology, 2023.

Bizim ölçümümüz bu sonucun kendi verimizle bağımsız bir doğrulaması: ağlama sesi kimlik ve yaş taşır, neden taşımaz.

“%96 doğruluk” iddiaları nereden çıkıyor

Bu kategoride yüksek doğruluk iddiaları yaygın; mekanizmayı da ölçtük. Veri setindeki 221 bebeğin 197'si (%89) tek bir etiketle katkı vermiş. Yani bebeği tanımak, etiketi bilmek anlamına geliyor. Kayıtları bebek bazlı değil rastgele bölersen aynı bebek hem eğitimde hem testte çıkıyor ve skor kendiliğinden yükseliyor: aynı veride 3 sınıflı görev %32,9'dan %35,5'e, “aç mı” görevi %49,1'den %59,3'e, “acı mı” görevi %50,9'dan %62,7'ye çıktı. Basit bir modelde bile 10-12 puan; büyük bir modelde çok daha fazlası.

İkinci etken ham doğruluk: kayıtların %83,6'sı “aç” etiketliyken hep “aç” diyen bir model bile yüksek bir yüzde alır. Rastgele bölme ile ham doğruluğu birleştirdiğinde etkileyici bir rakam çıkar — ve hiçbir şey ölçmez.

Piyasadaki bir modeli test ettik

Kategorideki bir uygulamanın modelini aynı veri üzerinde çalıştırdık. Sonuç ilan edilen rakamın çok altında kaldı; üstelik test, modelin muhtemelen eğitildiği veri üzerinde yapıldığı için modelin lehineydi. Uygulamayı burada adıyla anmıyoruz; amaç bir ürünü değil, bir yöntemi göstermek.

Daha önemlisi davranışı: mutlak sessizlik verdiğimizde %100 güvenle bir neden söyledi. Denediğimiz altı yapay girdinin altısında da güven %100'dü. Aynı kaydın farklı saniyelerine baktığında kliplerin yarısından fazlasında fikir değiştiriyordu — ve fikir değiştirirken ortalama güveni %96,9'du. Mağaza yorumlarındaki “sessiz odada bile sonuç veriyor” ve “aynı ağlamaya dört farklı cevap verdi” şikâyetlerinin sayısal karşılığı bu.

Ağlama tespiti çalışıyor, neden çalışmıyor

İki ayrı soru var ve biri gerçekten cevaplanabiliyor. “Bu ses bir ağlama mı?” Cevaplanabiliyor: kendi kalibrasyonumuzda gerçek ağlamaların ağlama skoru ortancası 0,737, en zorlu yapay girdininki 0,0095 çıktı — aradaki fark yaklaşık 78 kat. Eşiğimiz 0,02; gerçek ağlamaların yaklaşık %90'ını geçirirken yapay girdilerin tamamını engelliyor. “Bu ağlama neden?” Cevaplanamıyor; yukarıdaki tablo bu.

Agubu bu yüzden ne yapıyor

Sonuç bir cevap değil, sıralı ihtimallerdir. Belirsizliği gizlemek onu ortadan kaldırmaz; sadece sana yanlış bir güven verir. Özelliğin tamamı: bebek ağlama analizi; daha kısa anlatımı: Ağlama neden anlaşılmaz.

  1. Tespit: mikrofon 8 saniye dinler; cihaz-içi model sesin gerçekten ağlama olduğunu doğrular.
  2. Kalite kapısı: sessiz, gürültülü ya da kısa kayıt reddedilir. Sessizliğe neden uydurulmaz.
  3. Bağlamdan sıralama: son beslenmeden geçen süre, uyanık kalma süresi, son bez, yaş ve günün saati olası nedenleri olasılıklarıyla sıralar; yeterli örnek birikince senin geri bildirimin ağırlık kazanır.
  4. Belirsizliği söyleme: ihtimaller yakınsa sonuç “emin değilim” der ve ilk üç olasılığı listeler.

Kaynaklar

  • Kendi ölçümlerimiz — donateacry-corpus (457 kayıt, 221 bebek), YAMNet gömüleri, bebek bazlı çapraz doğrulama; uygulamanın içindeki “Nasıl çalışıyor?” sayfasında yeniden üretilebilir
  • Lockhart-Bouron ve ark., Infant cries convey both stable and dynamic information about age and identity, Communications Psychology, 2023 — https://www.nature.com/articles/s44271-023-00022-z
  • AudioSet tabanlı ağlama tespiti eşik kalibrasyonumuz
Agubu'nun uygulama içi “Nasıl çalışıyor?” sayfası: “Kısa cevap: sesten neden anlaşılmıyor” başlığı, altında “Bu klip hangi bebekten? +53,4 puan”, “Bebek kaç aylık? +6,9 puan” ve “Bu ağlama neden? −0,4 puan” satırları

Sık sorulan sorular

Agubu'nun doğruluk oranı kaç?

Bir yüzde vermiyoruz, çünkü sesten neden tahmini için verilebilecek dürüst bir yüzde şans düzeyidir; bunu yukarıdaki tabloda gösteriyoruz. Söyleyebildiğimiz ölçülmüş şeyler şunlar: ağlama tespiti gerçek ağlamaların yaklaşık %90'ını geçiriyor ve yapay girdilerin tamamını engelliyor; neden sıralaması sesten değil bağlamdan geliyor.

Başka uygulamalar “%96 doğruluk” diyor; yalan mı?

Çoğu zaman yalan değil, yanlış ölçüm: kayıtlar bebek bazlı değil rastgele bölünüyor ve ham doğruluk kullanılıyor. Aynı veride bu iki seçim skoru kendiliğinden yükseltiyor. Bebek bazlı bölüp dengeli doğruluğa baktığında rakam şans düzeyine iniyor.

Bu ölçümü kendim tekrar edebilir miyim?

Evet. Veri seti herkese açık (donateacry-corpus), gömüler YAMNet'ten, bölme bebek bazlı. Aynı adımları izleyen herkes aynı tabloya ulaşır; yöntem uygulamanın içindeki “Nasıl çalışıyor?” sayfasında da yazıyor.

Agubu'yu dene

iPhone ve Android'de ücretsiz. Hesap yok, reklam yok; kayıtlar telefonunda kalır.

App Store'dan indirGoogle Play'den al
Telefonda App Store'u ya da Google Play'i açan QR kod

Telefonunun kamerasıyla okut, uygulamayı indir