🦋🤖 Robo-Spun by IBF 🦋🤖
Model, literatür taramaları oluşturmak için faydalı olabilecek, atıf yapılmış ve sayfalarca uzunlukta raporlar üretiyor.
Teknoloji devi OpenAI, onlarca veya yüzlerce web sitesinden bilgileri sentezleyerek birkaç sayfa uzunluğunda, atıf yapılmış bir rapor haline getiren ‘derin araştırma’ adlı, erişim için ücretli bir araç tanıttı. Bu araç, Google’ın Aralık ayında piyasaya sürdüğü benzer bir aracın ardından geldi ve kişisel bir asistan gibi davranarak saatler sürecek işi onlarca dakikada yapıyor.
Bunu deneyen birçok bilim insanı, literatür taramaları veya tam kapsamlı inceleme makaleleri yazma ve hatta bilgi boşluklarını tespit etme konusundaki yeteneğinden etkilenmiş durumda. Ancak, bu konuda daha az hevesli olanlar da var. “Bunu bir insan yapsaydı şöyle derdim: bu raporun daha çok işi var,” diyor, Kaliforniya Moffett Field’deki Bay Area Çevresel Araştırma Enstitüsü’nde veri bilimci olan Kyle Kabasares, çevrimiçi bir video incelemesinde.
Firmalar, bu araçları, karmaşık görevleri üstlenebilecek yapay zekâ ‘ajanlarına’ doğru bir adım olarak sunuyor. Gözlemciler, 2 Şubat’ta piyasaya sürülen OpenAI’ın derin araştırma aracının, o3 büyük dil modelinin (LLM) geliştirilmiş akıl yürütme yeteneklerini İnternet arama becerisiyle birleştirdiği için dikkate değer olduğunu söylüyor. Google ise Deep Research aracının şu anda lider akıl yürütme modeli 2.0 Flash Thinking yerine Gemini 1.5 Pro’ya dayandığını belirtiyor.
Her iki aracı da kullanan birçok kişi etkilenmiş durumda. San Francisco, Kaliforniya’da bir girişim olan FutureHouse’ta kimyager ve yapay zekâ uzmanı Andrew White, Google’ın ürününün “Google’ın arama ve hesaplama konusundaki avantajlarını gerçekten kullanarak” kullanıcıları bir konu hakkında hızlıca bilgilendirdiğini, o3’ün akıl yürütme becerilerinin ise OpenAI raporlarına sofistike bir yapı kattığını söylüyor.
Connecticut, Farmington’daki Jackson Laboratuvarı’nda immünolog olan ve OpenAI tarafından tıbbi araştırmalar için ücretsiz ChatGPT Pro erişimi sağlanan Derya Unutmaz, OpenAI derin araştırma raporlarının “son derece etkileyici”, “güvenilir” ve yayımlanmış inceleme makaleleri kadar iyi veya onlardan daha iyi olduğunu söylüyor. “Bence inceleme yazmak artık demode hale geliyor.”
White, bu tür yapay zekâ sistemlerinin insan tarafından yazılmış incelemeleri güncellemek için kullanılabileceğini öngörüyor. “Yetkili incelemeler [insanlar tarafından] her 6 ayda bir güncellenemez.”
Ancak birçok kişi, tüm LLM tabanlı araçların bazen hatalı veya yanıltıcı olabileceği konusunda uyarıyor. OpenAI’ın web sitesi, aracının “hala erken aşamada olduğunu ve sınırlamaları bulunduğunu” kabul ediyor: yanlış atıf yapabilir, uydurma bilgiler oluşturabilir, otoriter bilgi ile söylentileri ayırt edemeyebilir ve belirsizliğini doğru bir şekilde yansıtamayabilir. Şirket, bu sorunların zamanla ve daha fazla kullanım ile düzeleceğini öngörüyor. Google’ın Deep Research aracı ise yalnızca “Gemini hata yapabilir, bu yüzden iki kez kontrol edin” şeklinde bir uyarı içeriyor.
Almanya, Erlangen’deki Max Planck Işık Bilimi Enstitüsü’nde Yapay Bilim İnsanı Laboratuvarı’nın lideri olan Mario Krenn, bu araçların bilim insanlarının genellikle kullandığı anlamda “araştırma” yapmadığını belirtiyor. Bilim insanları, diyor Krenn, tek bir konuyu yıllarca araştırır ve yeni fikirler geliştirir. “Bu yetenek [yapay zekâ tarafından] henüz gösterilmedi,” diyor ve ekliyor: “Belki yakında gösterilir, bu günlerde kimse emin olamıyor.”
Test sonuçları
OpenAI, derin araştırma aracını çeşitli testlere tabi tuttu. Örneğin, dilbilimden bilime kadar uzanan konularda uzman düzeyde bilgi içeren 3.000 soruluk bir kıyaslama testi olan İnsanlığın Son Sınavı’nda (HLE) iyi bir performans sergiledi ve LLM’ler için daha zor olacak şekilde tasarlanmış bu testte yalnızca metin tabanlı sorularda %26,6’lık bir başarı oranı elde etti.
Şirket ayrıca sistemini, soruları yanıtlamak için çok adımlı akıl yürütme ve web taraması kullanan yapay zekâyı test etmek amacıyla 2023’te geliştirilen GAIA kıyaslamasına karşı da test etti. GAIA’nın halka açık liderlik tablosunda, San Francisco şirketi Anthropic’ten Claude 3.5 Sonnet tarafından desteklenen küresel şirket H2O.ai’dan bir ajan, en zor seviyede %40,82 puanla birinci sırada yer alıyor. OpenAI’ın derin araştırma aracı ise %58,03 puan aldı.
Google, aracı için paylaşılacak herhangi bir kıyaslama sonucu olmadığını belirtiyor. OpenAI tarafından seçilen kıyaslamalar, kısa ve doğrulanabilir yanıtları olan sorulara dayanıyor ki bu, doğru bir cevabı olmayan uzun yanıtlar üreten araçlar için pek uygun olmayabilir, diyor White. “Bence bu kıyaslamalar yerini işlevsel kıyaslamalara bırakacak,” diyor; örneğin, makalelerin kalitesi ve faydasına yönelik insan değerlendirmeleri gibi. White daha önce, insan uzmanların bilimsel konuların yapay zekâ ve insan tarafından yazılmış Wikipedia tarzı özetlerinden alınan ifadeleri kör şekilde değerlendirdiği bir makale üzerinde çalışmıştı; yapay zekâ bu değerlendirmede galip gelmişti.
Her iki ürünün de başka sınırlamaları var. Hiçbiri, birçok bilimsel makaleyi içeren ücretli erişim gerektiren bilgileri çıkaramıyor. Bu “büyük, çok büyük bir sorun,” diyor açık bilim savunucusu olan Unutmaz. “Bu bilgiye erişim her zamankinden daha önemli,” diyor. Bazı bilim insanları, çevrimiçi forumlarda dergi şifrelerini yapay zekâ araçlarına entegre edebilmeleri gerektiğini öne sürdüler ve OpenAI’ın yeni ‘operatör’ ajanını bu amaçla kullanmayı tartıştılar. OpenAI’ın CEO’su Sam Altman bu konuya yanıt olarak bir tweet attı: “Bu konuda bir şeyler bulmamız gerekiyor.”
Kaynaklar
- Mialon, G. ve diğ. arXiv üzerinde ön baskı https://arxiv.org/abs/2311.12983 (2023).
- Skarlinski, M. D. ve diğ. arXiv üzerinde ön baskı https://arxiv.org/abs/2409.13740 (2024).






























Geri bildirim: Muhaberat Evirileri — özel sayfa | 🦋🤖 YERSİZ ŞEYLER