🦋🤖 Robo-Spun by IBF 🦋🤖
Küçük bir çalışma, ChatGPT’nin, tıbbi vaka geçmişlerini değerlendirirken doktorlardan daha başarılı olduğunu, hatta bu doktorların bir sohbet robotunu kullandıkları durumda bile daha iyi performans gösterdiğini ortaya koydu.
Bir deneyde, ChatGPT kullanarak teşhis koyan doktorlar, bu aracı kullanmayan doktorlardan yalnızca biraz daha iyi sonuç aldı. Ancak sohbet robotu, tek başına tüm doktorlardan daha iyi performans sergiledi.
Yazan: Gina Kolata
Tarih: 17 Kasım 2024
Boston’daki Beth Israel Deaconess Tıp Merkezi’nde iç hastalıkları uzmanı olan Dr. Adam Rodman, yapay zekâdan yararlanan sohbet robotlarının doktorların hastalıkları teşhis etmesine yardımcı olacağını kesin bir şekilde düşünüyordu.
Yanılmıştı.
Dr. Rodman’ın tasarımına yardımcı olduğu bir çalışmada, ChatGPT-4 ve geleneksel kaynaklarla donatılmış doktorlar, sohbet robotuna erişimi olmayan doktorlardan yalnızca biraz daha iyi sonuçlar elde etti. Ancak araştırmacıları asıl şaşırtan şey, yalnızca ChatGPT’nin tek başına doktorlardan daha iyi performans göstermesiydi.
“Şoke oldum,” dedi Dr. Rodman.
OpenAI şirketine ait olan sohbet robotu, bir vaka raporundan bir tıbbi durumu teşhis etme ve gerekçelerini açıklama konusunda ortalama %90 puan aldı. Sohbet robotunu kullanan doktorlar %76’lık bir ortalama puan aldı. Sohbet robotunu kullanmayan doktorların ortalama puanı ise %74 oldu.
Bu çalışma yalnızca sohbet robotunun üstün performansını göstermekle kalmadı.
Aynı zamanda, doktorların bazen yaptıkları teşhise olan sarsılmaz inancını ortaya çıkardı; bu inanç, bir sohbet robotu potansiyel olarak daha iyi bir teşhis önermiş olsa bile değişmedi.
Çalışma ayrıca doktorların, işlerinde yapay zekâ araçlarına maruz kalmasına rağmen, sohbet robotlarının yeteneklerini nasıl kullanacaklarını bilmediklerini de gözler önüne serdi. Sonuç olarak, doktorlar yapay zekâ sistemlerinin karmaşık teşhis problemlerini çözme ve teşhisler için açıklamalar sunma yeteneklerinden faydalanmayı başaramadılar.
Yapay zekâ sistemleri “doktor destekçisi” olmalı, dedi Dr. Rodman; teşhislerde değerli ikinci görüşler sunarak yardımcı olmalı.
Ancak bu potansiyelin gerçekleşmesine daha zaman olduğu görülüyor.
Vaka Geçmişi, Gelecek İhtimaller
Deney, birkaç büyük Amerikan hastane sisteminden toplanan 50 doktoru —asistanlar ve kıdemli doktorların bir karışımını— içeriyordu ve geçen ay JAMA Network Open dergisinde yayımlandı.
Deneklere altı vaka geçmişi verildi ve teşhis önerme ve bu teşhisleri neden tercih ettiklerini veya neden reddettiklerini açıklama becerileri değerlendirildi. Son teşhisi doğru tahmin etmeleri de notlandırıldı.
Derecelendirme, katılımcıların yalnızca yanıtlarını gören, ancak yanıtların bir doktor mu yoksa bir sohbet robotundan mı geldiğini bilmeyen tıbbi uzmanlar tarafından yapıldı.
Çalışmada kullanılan vaka geçmişleri gerçek hastalara dayanıyordu ve 1990’lardan beri araştırmacılar tarafından kullanılan 105 vaka setinin bir parçasıydı. Bu vakalar, tıp öğrencileri ve diğerlerinin ön bilgiye sahip olmadan test edilebilmesi için kasten yayımlanmamıştı. Bu durum aynı zamanda ChatGPT’nin bu vakalar üzerinde eğitilmemiş olduğu anlamına geliyordu.
Ancak, çalışmanın ne içerdiğini göstermek için, araştırmacılar doktorların test edildiği altı vakadan birini ve bu vakaya yönelik test sorularına verilen yüksek ve düşük puanlı yanıtları yayımladı.
Bu test vakası, koroner bir arterin genişletilmesi için yapılan balon anjiyoplasti işleminden birkaç gün sonra alt sırtında, kalçalarında ve baldırlarında şiddetli ağrı yaşayan 76 yaşında bir hastayı içeriyordu. Hastaya işlemden sonraki 48 saat boyunca kan sulandırıcı heparin verilmişti.
Adam kendini ateşli ve yorgun hissettiğini belirtti. Kardiyoloğu, yeni başlayan bir anemi ve kandaki azot ile diğer böbrek atık ürünlerinin birikimini gösteren laboratuvar çalışmaları yapmıştı. Adam, bir on yıl önce kalp hastalığı nedeniyle bypass ameliyatı geçirmişti.
Vaka özeti, adamın fizik muayene detaylarını ve ardından laboratuvar test sonuçlarını içeriyordu.
Doğru teşhis, kolesterol embolisi idi — kolesterol plaklarından kopan parçaların damarları tıkadığı bir durum.
Katılımcılardan üç olası teşhis yapmaları ve her birini destekleyen kanıtları sağlamaları istendi. Ayrıca, her olası teşhis için, bu teşhisi desteklemeyen veya beklenen ancak mevcut olmayan bulguları sunmaları istendi.
Katılımcılar ayrıca nihai teşhisi sağlamalıydı. Ardından, tanı sürecinde atacakları üç adımı daha belirtmeleri gerekiyordu.
Yayımlanan vaka için teşhis gibi, çalışmadaki diğer beş vaka da kolayca anlaşılabilecek türden değildi. Ancak ne de neredeyse duyulmamış kadar nadirdi. Yine de doktorlar ortalamada sohbet robotundan daha kötü performans gösterdi.
Araştırmacılar, “Neler oluyordu?” diye sordu.
Yanıt, doktorların nasıl teşhis koydukları ve yapay zekâ gibi bir aracı nasıl kullandıklarıyla ilgili sorulara dayanıyor gibi görünüyor.
Makinedeki Doktor
O zaman, doktorlar hastaları nasıl teşhis eder?
Sorun şu ki, “Doktorların nasıl düşündüğünü gerçekten bilmiyoruz,” dedi çalışmaya dahil olmayan Brigham and Women’s Hastanesi’nden tıp tarihçisi Dr. Andrew Lea.
Bir teşhisle nasıl geldiklerini açıklarken, doktorlar “sezgi” ya da “tecrübelerime dayanarak” gibi ifadeler kullanır, dedi Dr. Lea.
Bu tür belirsizlik, bilgisayar programlarının bir doktor gibi düşünebilmesini sağlamaya çalışan araştırmacıları onlarca yıldır zorlamıştır.
Bu arayış yaklaşık 70 yıl önce başladı.
“Bilgisayarlar icat edildiğinden beri, onları teşhis koymak için kullanmaya çalışan insanlar olmuştur,” dedi Dr. Lea.
En iddialı girişimlerden biri 1970’lerde Pittsburgh Üniversitesi’nde başladı. Orada bilgisayar bilimcileri, tıp fakültesinin iç hastalıkları bölümünün başkanı ve usta bir tanı koyucu olarak bilinen Dr. Jack Myers’ı işe aldı. Dr. Myers, fotoğrafik bir hafızaya sahipti ve tıpta bilinen her şeyi öğrenmeye çalışarak haftada 20 saatini tıp kütüphanesinde geçiriyordu.
Dr. Myers’a vaka detayları verildi ve teşhisleri üzerinde düşünürken akıl yürütmesini açıkladı. Bilgisayar bilimcileri onun mantık zincirlerini koda dönüştürdü. Sonuçta ortaya çıkan program, INTERNIST-1, 500’den fazla hastalık ve yaklaşık 3.500 hastalık belirtisini içeriyordu.
Araştırmacılar, programı New England Journal of Medicine’den alınan vakalarla test etti. “Bilgisayar gerçekten çok başarılıydı,” dedi Dr. Rodman. Performansı “muhtemelen bir insanın yapabileceğinden daha iyiydi,” diye ekledi.
Ancak INTERNIST-1 yaygınlaşmadı. Kullanımı zordu; bir teşhis koyması için bir saatten fazla bilgi girişi gerekiyordu. Ayrıca, yaratıcılarının belirttiği gibi, “programın mevcut hali klinik uygulamalar için yeterince güvenilir değildi.”
Araştırmalar devam etti. 1990’ların ortalarına gelindiğinde, tıbbi teşhis koymaya çalışan yaklaşık yarım düzine bilgisayar programı vardı. Hiçbiri yaygın olarak kullanılmadı.
“Bu sadece kullanıcı dostu olması gerektiği anlamına gelmiyor, doktorların da ona güvenmesi gerekiyordu,” dedi Dr. Rodman.
Ve doktorların nasıl düşündüğüne dair belirsizlikle birlikte, uzmanlar, bu duruma ne kadar önem vermeleri gerektiğini sorgulamaya başladı.
Operator Hatası
Dr. Rodman, yeni çalışmanın sonuçlarından duyduğu ilk şoktan sonra, verilere biraz daha derinlemesine bakmaya ve doktorlar ile ChatGPT arasındaki mesaj günlüklerini incelemeye karar verdi. Doktorlar sohbet robotunun teşhislerini ve gerekçelerini görmüş olmalıydı; peki neden chatbotu kullanan doktorlar daha iyi sonuçlar elde etmedi?
Araştırmalar,
doktorların genellikle sohbet robotunun teşhisleriyle çelişen bir noktaya işaret ettiğinde buna ikna olmadıklarını ortaya çıkardı. Aksine, kendi teşhis fikrine bağlı kalma eğilimindeydiler.
“Yapay zekâ, onlara kabul etmedikleri bir şey söylediğinde bunu dinlemediler,” dedi Dr. Rodman.
Bu durum, Rotterdam’daki Erasmus Tıp Merkezi’nde klinik akıl yürütme ve teşhis hatalarını inceleyen ve çalışmaya dahil olmayan Laura Zwaan’a göre mantıklı.
“İnsanlar genellikle haklı olduklarını düşündüklerinde aşırı özgüvenlidirler,” dedi.
Ancak bir başka sorun daha vardı: Birçok doktor, bir sohbet robotunu tam kapasitesiyle nasıl kullanacağını bilmiyordu.






























Geri bildirim: Eviri — özel sayfa | YERSİZ ŞEYLER
Geri bildirim: Muhaberat Evirileri — özel sayfa | 🦋🤖 YERSİZ ŞEYLER