🦋🤖 Robo-Spun by IBF 🦋🤖
YZ hizmetlerinin kullanımındaki büyüme şaşırtıcı oldu; bundan sonra daha da şaşırtıcı olmasını bekliyoruz.
YZ akıllandıkça, YZ’ye erişim ekonominin temel itici gücü olacak ve belki de sonunda temel bir insan hakkı sayılacak. Neredeyse herkes kendi adına çalışan daha fazla YZ isteyecek.
Dünyanın ihtiyaç duyduğunu sağlayabilmek için — bu modelleri çalıştıracak çıkarım hesaplaması ve onları gitgide daha iyi kılacak eğitim hesaplaması — YZ altyapısını kurma konusundaki hedeflerimizi anlamlı ölçüde genişletebilmek üzere gereken zemini hazırlıyoruz.
YZ, gideceğini düşündüğümüz rotada kalırsa, olağanüstü şeyler mümkün olacak. Belki 10 gigawatt hesaplama gücüyle YZ, kanseri nasıl tedavi edeceğini bulabilir. Ya da 10 gigawatt hesaplama gücüyle YZ, yeryüzündeki her öğrenciye kişiselleştirilmiş özel ders sağlayabilmenin yolunu bulabilir. Hesaplama gücüyle sınırlanırsak, hangisine öncelik vereceğimize karar vermek zorunda kalacağız; kimse bu tercihi yapmak istemiyor, öyleyse haydi inşa edelim.
Vizyonumuz basit: Her hafta bir gigawatt yeni YZ altyapısı üretebilen bir fabrika kurmak istiyoruz. Bunu hayata geçirmek son derece zor olacak; bu dönüm noktasına ulaşmamız yıllar alacak ve yığının her katmanında — çiplerden enerjiye, inşaattan robotiğe — yenilik gerektirecek. Ancak bunun üzerinde çok sıkı çalışıyoruz ve bunun mümkün olduğuna inanıyoruz. Bize göre bu, gelmiş geçmiş en havalı ve en önemli altyapı projesi olacak. Bunun büyük bir bölümünü ABD’de inşa etmekten özellikle heyecan duyuyoruz; şu anda diğer ülkeler çip fabrikaları ve yeni enerji üretimi gibi işleri bizden çok daha hızlı yapıyor, biz de bu gidişatı tersine çevirmeye katkı sunmak istiyoruz.
Önümüzdeki birkaç ay boyunca, bunu gerçeğe dönüştürmek için üzerinde çalıştığımız bazı planlardan ve ortaklardan söz edeceğiz. Yılın ilerleyen döneminde, bunu nasıl finanse ettiğimizi konuşacağız; hesaplama kapasitesini artırmanın geliri artırmanın kelimenin tam anlamıyla anahtarı olduğu düşünülürse, elimizde ilginç yeni fikirler var.
Jakub ve Szymon
YZ son yıllarda dikkate değer biçimde daha iyi hale geldi; ChatGPT, artık kanıksadığımız harika şeyler yapabiliyor. Bu böyle olmalıydı zaten ve bu, insan ilerlemesinin hikâyesidir. Ama o yanıp sönen dairenin ardında, ustalıkla soyutlanmış şekilde, benim bugüne dek gördüğüm en büyük insan zekâsı hikâyesi yatıyor. Birçok insan, çoğu uzmanın bu zaman diliminde imkânsız gördüğü bir şeyi nasıl inşa edeceğimizi keşfetmek ve insanların ondan faydalanmasını sağlamak için dev ölçekli ürünler sunan bir şirket kurmak adına akıl almaz bir gayretle çalıştı. Çoğu ChatGPT kullanıcısı, içine bu kadar emek koyan insanları hiç düşünmeyecek; bu tamamen normal, ama yine de sizden bir dakikanızı rica ederek…
OpenAI, onsuz OpenAI olamayacağına inandığım iki kişiden bahsetmek istiyorum: Jakub Pachocki ve Szymon Sidor. Defalarca, araştırma ile mühendisliği birleştirip imkânsız görünen problemleri çözdüler. Yeterince kamuoyu kredisi almadılar; oysa RL’yi, yaygın kanaatin ölçeklenmediği yönünde olduğu bir dönemde, nerede koptuğunu görmek için bir taban çizgisi olarak ölçeklemeye karar vermeleri Dota sonucumuza giden yolu açtı; bilimsel keşiflerimizin çoğunu mümkün kılan altyapının büyük bölümünü inşa ettiler; GPT-4 ön-eğitimine liderlik ettiler; Ilya ve Lukasz ile birlikte akıl yürütme atılımına götüren ilk fikirleri ileri taşıdılar ve yeni paradigmaları keşfetme konusunda kayda değer ilerleme kaydettiler.
Jakub baş bilim insanımız. Bir keresinde Szymon’ı ‘indefatigable’ (yorulmak bilmez) diye tanımlamıştı; bu kelimenin şimdiye dek duyduğum en kusursuz kullanımlarından biridir. OpenAI henüz onlara çözemeyecekleri bir problem atmadı; geçmişte iki insanın birbirini bu kadar iyi tamamlayabildiği araştırma laboratuvarı ortaklıkları hakkında hikâyeler duymuştum, fakat bunun yıllar içinde gözlerimin önünde açılışını izleyebilmek gerçekten çok özel.
‘Yapay zekâ modelleri özgün araştırma yapabiliyor’: OpenAI’nin baş bilim insanı neler beklememiz gerektiğini anlatıyor
Gelişmiş modellerin geliştirilmesini yöneten Jakub Pachocki, araştırmacılara açık bir sürümü sunma konusunda heyecanlı.
Elizabeth Gibney
12 Mayıs 2025
Jakub Pachocki, 2024’ten beri OpenAI’nin baş bilim insanı. Kaynak: OpenAI
OpenAI, en çok 2022’de piyasaya çıktıktan sonra evlere giren, büyük dil modeli tabanlı ve ücretsiz bir sohbet robotu olan ChatGPT ile tanınıyor. Firma, Kaliforniya’nın San Francisco kentinde, o tarihten bu yana adım adım ‘düşünme’ süreçleriyle mantıksal görevlere uzmanlaşan ‘akıl yürütme’ modelleri de dahil olmak üzere bir dizi son teknoloji yapay zekâ (YZ) aracı yayımladı.
Bu araçlar, araştırmacıların metinlerini cilalamalarına, kod yazmalarına, literatürü gözden geçirmelerine ve hatta hipotez üretmelerine yardımcı oldu. Ancak, diğer teknoloji rakipleri gibi, OpenAI de modellerinin enerji gereksinimleri ve verilerin bu modelleri eğitmek için nasıl kullanıldığı konusunda eleştirilerle karşılaştı. Ve bazı firmaların aksine, OpenAI neredeyse yalnızca araştırmacıların kullanabildiği ama üzerine inşa edemediği mülkiyetli modeller yayımladı.
Jakub Pachocki 2024’ten beri firmanın baş bilim insanı. Akademiden 2017’de OpenAI’ye katıldı; kendisi kuramsal bir bilgisayar bilimci ve rekabetçi programcıydı. Şimdi, bilim, matematik ve kodlamada karmaşık görevlerin üstesinden gelmek üzere tasarlanan şirketin en gelişmiş YZ sistemlerinin geliştirilmesine liderlik ediyor.
Nature, Pachocki ile YZ’nin özgün bilim üretebilip üretemeyeceği, yapay genel zekâ (AGI) ve firmanın yakında çıkacak açık ağırlıklı modeli hakkında konuştu.
Bilim insanları giderek daha fazla akıl yürütme modellerini kullanıyor. Bu modeller beş yıl içinde hangi rolü üstlenebilir?
Bugün bir modelle konuşabiliyorsunuz, ancak bu yalnızca sürekli yönlendirme gerektiren bir asistan. Değişecek olanın başlıcasının bu olmasını bekliyorum.
Şimdiden, OpenAI’nin Deep Research’ü [çok miktarda bilgiyi sentezleyebilen bir araç] gibi bir şeyin, 10 ya da 20 dakika boyunca gözetimsiz çalışıp işe yarar bir şey üretebildiğini görüyoruz. Ama bu soruları çözerken harcanan hesaplama gücü çok küçük.
Eğer elinizde açık araştırma problemleri varsa, bunun üzerine çok daha fazla hesaplama gücü harcamaya değerdir. YZ’lerin gerçekten özgün araştırma yapabilecek kapasitede olacağını bekliyorum. Örneğin, otonom yazılım mühendisliği ve donanım bileşenlerinin otonom tasarımı alanlarında ve diğer disiplinlerde benzer uygulamalarda çok ilerleme göreceğiz.
Pekiştirmeli öğrenme — deneme, yanılma ve ödüle dayalı yinelemeli öğrenme süreci — OpenAI’nin akıl yürütme modellerini oluşturmakta ne kadar önemli oldu?
İlk ChatGPT sürümleri, modelin devasa miktarda veriyi yutarak bir tür ‘dünya modeli’ kurduğu gözetimsiz bir ön eğitim aşamasını içeriyordu. Bunun içinden, insan geribildirimi kullanılarak pekiştirmeli öğrenme süreciyle faydalı bir asistan çıkarıyoruz.
Bu son ilerlemeyi akıl yürütme modellerinde şu şekilde görmek mümkün: Pekiştirmeli öğrenme aşamasının vurgusu gerçekten artıyor; yani yalnızca bir şeyler çıkarmakla kalmıyor, aynı zamanda modele kendi düşünme yolunu bulma imkânı veriyoruz.
Soru şu ki, bu öğrenme aşamalarını ayrı ayrı düşünmeye devam etmeli miyiz? Akıl yürütme modelleri boşlukta düşünmeyi öğrenmiyor; ön eğitimle öğrenmiş bir modele kök salıyorlar. Dikkatimin önemli bir kısmı bu aşamayı düşünmeye, yaklaşımları birleştirmeye ve etkileşimlerini anlamaya ayrılmış durumda.
Modellerin ‘düşünmesinden’ söz ediyorsunuz. Modeller gerçekten akıl mı yürütüyor? Yoksa akıl yürütmeye benzeyen bir şeyi mi yaklaşıklıyorlar?
Açık olmamız gereken bir şey şu: Modellerin çalışma biçimi, insan beyninin çalışma biçiminden farklı. Ön eğitimli bir model dünya hakkında bazı şeyler öğrenmiştir, ancak bunları nasıl öğrendiğine dair bir kavrayışı yoktur ya da şeyleri ne zaman öğrendiğine ilişkin herhangi bir zamansal sır duyumu bulunmaz.
Modellerin özgün içgörüler keşfetme kapasitesine sahip olduğuna dair kayda değer kanıtlarımız olduğuna kesinlikle inanıyorum. Bunun bir tür akıl yürütme olduğunu söyleyebilirim, ancak bu, insanın akıl yürütmesiyle aynı olduğu anlamına gelmiyor.
OpenAI’nin tepe yöneticisi Sam Altman, firmanın yakında 2019’daki GPT-2’den bu yana ilk kez açık bir modeli yayımlayacağını söyledi. Bu planlar hakkında ne söyleyebilirsiniz?
Özellikle araştırmacılara açık ağırlıklı bir model sunma fırsatı konusunda oldukça heyecanlıyım [indirip daha fazla eğitebilecekleri bir model]. Bu modeller daha yetkin hâle geldikçe, onları farklı şekillerde dağıtmanın insanlar üzerindeki etkisini anlamak konusunda giderek artan bir sorumluluğumuz var.
Güvenlik kaygıları nedeniyle [en ileri] sınır modellerini açık ağırlıklarla yayımlamamızın bizim için çok zor olacağını düşünüyorum. Mevcut açık modellerden daha iyi bir şeyi yayımlamak istiyorum.
AGI’nin tanımınız nedir ve sizce ne zaman, eğer olursa, buna ulaşırız?
Zaman çizelgelerim, ama aynı zamanda tanımım da, esaslı biçimde değişti. Lisansüstü eğitime başlarken AGI için gördüğüm dönüm noktası Go oyununa ustalıkla hâkim olmaktı ve bunun onlarca yıl alacağını düşünüyordum. Elbette bu eşik 2016’da aşıldı; bu benim için dünyayı yerinden oynatan bir andı.
2017’de OpenAI’ye katıldığımda, şirketteki en büyük kuşkuculardan biri olmaya devam ediyordum, ancak dönüm noktaları beklediğimden hızlı düştü. Turing testinde büyük ilerleme kaydettik. Ardından şu soru geldi: Peki ya matematik ve problem çözme? Onlarda da çok ilerleme kaydettik ve en zor kıyas ölçütlerinin de oldukça hızlı biçimde geride bırakılacağını bekliyorum.
Dolayısıyla üzerinde düşündüğüm bir sonraki çok büyük dönüm noktası, YZ’nin gerçekten ölçülebilir ekonomik etki yaratması ve özellikle özgün araştırma üretebilmesi. Bu, benim geçmişte duygusal olarak AGI diye düşündüğüme en yakın olan şey. Biz de buna odaklanıyoruz ve bu konuda bu on yıl bitmeden çok ciddi ilerleme bekliyorum. Hatta bu yıl bile YZ’nin, belki büyük bilimsel problemleri çözmese de, neredeyse otonom biçimde değerli yazılımlar üreteceğini öngörüyorum.
Andrew Mayne: Merhaba, ben Andrew Mayne ve burası OpenAI podcast’i. Bugünkü konuklarımız OpenAI’nin Baş Bilim İnsanı Jakub Pachocki ve Szymon Sidor. Yapay zekâ ilerlemesini nasıl ölçtüğümüzü, AGI’yi nasıl tanımladığımızı ve bir sonraki atılımın nereden gelebileceğini konuşacağız.
Andrew Mayne: Model, bu problemde ilerleme kaydetmediğini doğru şekilde saptayabildi. OpenAI’de araştırma programımızı nasıl şekillendirdiğimize dair düşünürken, örgüt olarak inanılmaz hızlı bir ilerleme temposuna hazır mıyız sorusunu çok ama çok ciddi biçimde sormaya başladık. Biz çok genel bir zekâ yaratmayı hedefliyoruz.
Andrew Mayne: Önce rollerinizi anlamakla başlamak istiyorum. Jakub, sen OpenAI’de baş araştırmacı—yani baş bilim insanı mısın?
Jakub Pachocki: Baş bilim insanı.
Andrew Mayne: Evet. Peki. ‘Baş bilim insanı’ ne demek?
Jakub Pachocki: Benim birincil sorumluluğum şirket için araştırma yol haritasını belirlemek—hangi teknik hatta bahis oynayacağımıza ve peşinden gideceğimiz uzun vadeli temel araştırmanın ne olduğuna karar vermek.
Andrew Mayne: Peki ya sen, Szymon? Ne yapıyorsun?
Szymon Sidor: Aklıma gelen her şeyden biraz.
Andrew Mayne: Her şeyden biraz, tamam.
Szymon Sidor: Çoğunlukla IC (bireysel katkı) işi yapıyorum. Arada biraz liderlik serpiştiriyorum belki; en faydalı olan ne ise onu yapmaya çalışıyorum.
Andrew Mayne: OpenAI’de çalışmadan önce birbirinizi tanıyordunuz, değil mi?
Szymon Sidor: Evet, aynı liseye gittik.
Andrew Mayne: Aynı lise—evet. Arkadaş mıydınız?
Szymon Sidor: En iyi arkadaş olmamız sanırım ayrıldıktan sonra oldu. ABD’ye gelmek gibi duygusal bir deneyim bağlar kuruyor. Lisede daha çok meslektaş gibiydik.
Andrew Mayne: Sizin gibi insanları yetiştiren nasıl bir lise?
Jakub Pachocki: Polonya’da bir liseye gittik. İkimiz de bilgisayar bilimi öğretmeni Ryszard Subarowski’nin çekim alanına girmiştik; kendisinin—biz gitmeden önce bile—bilgisayar bilimcileri ve programcılar yetiştirme konusunda güçlü bir geçmişi vardı; programlama yarışmalarına ve tek bir alanda mükemmellik peşinde koşmaya büyük vurgu yapıyordu. Bu bizim için çok biçimlendirici bir deneyimdi ve kendisi harika bir rehberdi.
Szymon Sidor: Kesinlikle. Müfredat programlamaya çok derinden giriyordu—tipik bir lise müfredatını fazlasıyla aşıyordu. Graf teorisi, matrisler ve bunun gibi pek çok şey vardı. Bugünlerde ChatGPT ile insanların bu tür derin dalışları yapmasının biraz daha kolay olmasını umuyorum; çünkü doğru mentor ve bir sürü emek olmadan o deneyimi kopyalamak zor.
Andrew Mayne: Ben onu bir şeyleri açıklatmak için kullanıyorum. Kapı seçtiğiniz Monty Hall problemi var ya; ChatGPT’ye ‘Bunun grafikli etkileşimli bir sürümünü yap’ diyebiliyorsunuz ve bir anda gözünüzde canlanıyor. Yaptıklarınıza göre farklı çözümleri gösterebiliyor. Sadece metinle açıklama değil, çoklu ortam şeyler kurabilme yeteneği beni heyecanlandırıyor. Ve bu, aslında ölçüsü pek olmayan bir alana giriyor—daha önce var olmayan bir kullanım durumu. AGI’den söz ediyoruz ama tanımlarımız epey gevşek; bunu hem teknik bakış açısından hem de sıradan birine nasıl anlatacağınızı duymak isterim.
Jakub Pachocki: Öğretme konusuna değinmek gerekirse: kavramların daha iyi açıklanması ve seçilmiş yöntemlerin öğretilmesi ChatGPT’nin güçlü bir kullanım alanı ve bence bizim Bay Subarowski gibi bir öğretmenin elinde çok iyi çalışıyor. Aynı zamanda onun sağladığı şey duygusal destek ve alan açmaktı; bunun tek başına yapay zekâ için zor olacağını düşünüyorum.
Andrew Mayne: Harika bir nokta. İnsanlar ‘Yapay zekâ eğitimin yerini alacak’ dediğinde bu kayboluyor. Benim öğretmenlerim vardı; verdikleri bilgiler her zaman doğru değildi ama yürekleri oradaydı, önemserlerdi ve soruları yanıtlardı. Bu araçlar onun tamamlayıcısı; ve bu araçları kullanan bir öğretmen daha yetkin bir öğretmen olabilir.
Jakub Pachocki: Evet.
Andrew Mayne: AGI konusuna dönersek, bana teknik tanımını ver—aslında önce teknik olmayanı ver. Bunu daha küçük bir kardeşine anlatır gibi nasıl tarif edersin?
Jakub Pachocki: Birkaç yıl önce AGI hakkında konuştuğumuzda, derin öğrenme teknolojisinin muazzam bir vaat taşıdığı hissi vardı ama kavram hâlâ biraz soyut ve uzak geliyordu. İnsan düzeyi zekâdan, doğal biçimde sohbet edebilmekten, matematik problemleri çözebilmekten veya araştırma yapmaktan söz edersen—bunların hepsi aynı uzamda gibi görünüyordu. Teknoloji ilerledikçe bunların aslında oldukça farklı yetenekler olduğunu görüyoruz. Yapay zekânın çok geniş konu yelpazesinde doğal biçimde sohbet edebildiği noktanın epey net bir şekilde içindeyiz. Matematik problemleri çözebiliyor. IMO’da altın madalya düzeyine ulaşmak, uzun zamandır AGI yolundaki bir kilometre taşı olarak konuştuğumuz bir şeydi—ve bu gerçekleşti. Ulusal matematik ligindeki tüm problemleri çözmek aslında biraz daha zor; bu da yoldaki başka bir kilometre taşı. Giderek, tek tek noktalara bakan ölçümlerin yetersiz kaldığını görüyoruz; bu yüzden dünyadaki gerçek etkiye bakmaya yöneliyoruz.
Jakub Pachocki: Benim için yapay zekâ ilerlemesinin dünyayı en anlamlı etkilediği yer, yeni teknolojinin keşfini ve üretimini otomatikleştirmek. Yeni fikirleri—temel teknolojik ilerlemeyi—insan yaratıcılığıyla özdeşleştirme eğilimindeyiz. İlerlemeyi büyük dönüm icatlarla ve teknolojik devrimlerle ölçüyoruz. Bunu içselleştirmek zor ama bu sürecin çoğunu otomatikleştirmek mümkün. Dünyayı temelinden değiştiren fikirler bulan büyük bir bilgisayara sahip olmak mümkün; bunun çok uzakta olduğunu da sanmıyorum. O yüzden, bizi bundan ayıran şeylerin ne olduğu ve böyle bir teknolojinin sonuçlarının ne olacağı üzerine düşünüyorum.
Andrew Mayne: Küçük bir Mac Studio sipariş ettim; açık kaynak model GPT-OS’u alıp durmaksızın çalıştırmak istiyorum. Onun 7/24 üretip bir şeyler yapmasına izin verme fikri beni büyülüyor. Ama sen bilimi temelde devasa ölçekte otomatikleştirmekten söz ediyorsun. İlk olarak hangi tür keşifleri görebileceğimizi düşünüyorsun?
Jakub Pachocki: OpenAI’de araştırma programımızı şekillendirirken çok genel bir zekâ yaratmayı hedefliyoruz. Öncelik olarak otomatikleştirilmiş araştırmacıya doğru ilerliyoruz ama bunu birkaç belirli alana götürüp oraya konuşlandırmak gibi görmüyoruz. Bu, tek tek noktalarda daha hızlı ilerleme sağlar ama gerçekten büyük keşiflerin ve en anlamlı teknolojik ilerlemenin potansiyeli genellikten geliyor. Yine de teknolojinin bazı alanlarda diğerlerinden daha kolay uygulanabildiğini görüyoruz—özellikle çok miktarda akıl yürütmenin alan bilgisi ve sezgiyle birleştiği yerlerde. Tıpta olağanüstü sonuçlar görüyoruz; bu çok cesaret verici ve umutlarımı büyütüyor. Doğal olarak, bir yapay zekâ araştırmacıları şirketi olarak kendi işimizi otomatikleştirmeyi de çok düşünüyoruz. Yapay zekâ, yapay zekâ araştırmasını otomatikleştirebilecek bir noktaya gelebilirse, bu muhtemelen otomatikleştirilmesi çok önemli bir şeydir; benzer şekilde, yapay zekâ hizalama ve güvenliği üzerine araştırmayı otomatikleştirmek de öyle.
Szymon Sidor: IMO sonuçlarından etkilendim. Geçmişte, Jakub’la IMO hakkında konuştuğumuzda—birkaç yıl önce—AGI tanımımızın ne olabileceğini hâlâ anlamaya çalışıyorduk. Düşündüğümüz kavramlardan biri Matematik Olimpiyatı’ndaki tüm problemleri çözmekti. Bu neden uygun geliyordu? Eğer üstün bir matematiksel akıl yürütmeye sahip bir modeliniz varsa, matematiksel olarak modellenebilen bir sürü farklı alanı altüst edebilmeliydi.
Szymon Sidor: Belki bu podcast, biraz da içerden bir perspektif paylaşmak için iyi bir fırsattır. İlerleme karşısında şaşkınım. Bazen ‘Yapay zekânın ekonomik etkisi sadece %3 ya da %5’ gibi manşetler görüyorum; ‘Yapay zekâ yavaşlıyor’ ya da ‘İnsanlar yapay zekâyı gereğinden fazla abartıyor; sadece %3’ gibi yorumlar eşlik ediyor. Bunları görünce, 10 yıl önce derin öğrenmeyle NLP üzerinde çalıştığım zamanları hatırlıyorum; o zamanlar pek çalışmıyordu. Jakub’un bir keresinde üzerinde çalıştığımız duygu tespiti modelini test edişini hatırlıyorum: ‘Bu film kötü’ → negatif, ‘Bu film iyi’ → pozitif, sonra ‘Bu film kötü değil’ dedi ve model negatif dedi. Bu 10 yıl önceydi. O zamandan bu yana yavaş yavaş bu tür görevleri çözmeye başladık; sonra ‘Bu sözcük isim mi fiil mi’ gibi görevler (o ‘sentiment neuron’ dönemi). Ardından GPT-1, GPT-2 bir anda anlamlı paragraflar üretmeye başladı—bu muazzam bir atılımdı. Sonra GPT-3, GPT-4. GPT-4 benim kişisel AGI ânımdı, çünkü bazen beni şaşırtan şeyler söylerdi. Bir model beni gerçekten şaşırtabilir mi?
Szymon Sidor: O zamanlar, kişisel kullanımımda ChatGPT daha incelikli, biraz daha iyi bir arama motoru gibi geliyordu—‘Büyük olay ne?’ Sonra Deep Research geldi ve soruları yanıtlayıp neredeyse hiç uydurmamaya başladı. Bu faydalı geldi. Nihayet, şimdi programlama yarışmalarında yarışabilen modellerimiz var—bu benim için kişisel olarak zor kazanılmış bir şeydi; Jakub için daha da fazla. Bu teknolojide çalışan biri gözüyle ilerleme temposu kesinlikle akıl almaz. Bugün %3 ise, 10 yıl önce muhtemelen %0,00001 gibi bir şey olurdu. Bu sayıların bağlama oturtulması gerekiyor. Bir yıl içinde %10, iki yıl içinde %20 olamayacağına dair bir neden yok.
Andrew Mayne: 90’ların başından itibaren ekonominin grafiğine bakıp internete ‘işte burada’ diye parmak basmaya çalışırsanız yapamazsınız denir; ‘Tim Berners-Lee bunu duyurdu’ gibi bir noktayı işaretleyip eğride bir kırılma göremezsiniz. Yapay zekâ da buna benziyor. Ölçülerimiz zor; kimin nasıl kullandığını bilmek güç. Uzun süredir takip ediyorsanız, kendi bilgisayarınızda çok basit bir karakter-tahminleyiciyi eğittiğinizi hatırlarsınız—berbattı. Sonra duygu analizi. BERT ile oynarsınız, eh. GPT-2 çıkar; her çıktısını okur, bir şeyler oluyor dersiniz. Ben OpenAI’de çalışmaya böyle başladım; buna takıntılıydım. GPT-3’e erişimle birlikte ‘Bu yol ilerliyor’ demeye devam ettim. Şimdi, altı hafta geçip bir kıyas ölçütü (benchmark) kırılmayınca insanlar ‘Duvara tosladık’ diyor. Ama kıyas ölçütleri bazen ılımlı iyileşmeler gösterir; bazılarında yanlış cevaplar vardır—doğru yanıt verdiğinizde bile %100 almak imkânsız olur. Biz içeride ‘doyum’dan söz ediyoruz. Bundan biraz bahsetmek ister misin?
Jakub Pachocki: Şu anda kıyas ölçütleriyle karşılaştığımız birkaç mesele var. Açık olanlardan biri doyum: standartlaştırılmış zekâ ya da yetenek ölçümlerinde, modellerin birçoğunda insan düzeyine gerçekten ulaşması. Dünyanın en iyilerinin katıldığı çok zor lise yarışmalarında en üstler arasında yer alabiliyorsanız, çok kısıtlı ölçümleri sürdürmek zorlaşıyor. Daha önce, GPT-1/-2/-3/-4 ölçekleme paradigmasında, kıyas ölçütleri gerçekten yükselen gelgiti ölçüyordu. Şimdi alan, belirli yetenekler için daha veri-verimli eğitim yolları geliştirdi. Örneğin, yazma becerisine kıyasla orantısız şekilde matematikte iyi olan modeller eğitebilirsiniz; matematik kıyas ölçütlerinde daha iyi sonuç verirler, ama bu artık diğer konulardaki genel zekâlarını temsil etmez. Bu iki mesele birleşince, gerçekten bu modellerin ‘ödül faydasını (utility)’ ve özellikle yeni içgörüler keşfetme yeteneklerini düşünmemiz gerektiğini gösteriyor.
Andrew Mayne: Gerçekten çok iyi sınav çözen bir model inşa edebilirsiniz ama iş için pek kullanışlı olmayabilir. İdeal olarak, modeliniz testlerde iyi puan almalı; fakat belirli puanlar almış olması sizin için kişisel olarak faydalı olacağı anlamına gelmez. Şu anki zorluk, insanlar ‘Model iyi mi kötü mü?’ diye sorduğunda—kullanım durumları yüzlerceyken—genel bir yargı vermeye çalışmak. Belki yaratıcı yazmada harika ama matematikte kötü; ya da tersi. IMO ve Uluslararası Enformatik Olimpiyatı gibi metrikler neden önemli? Neden modelleri insan düzeyi yarışmalara sokmak?
Jakub Pachocki: IMO ve IOI gibi yarışmalar bizi heyecanlandırdı çünkü bilgi gereksinimi çok olmayan, ama bir problemi bir—iki—üç saat boyunca ciddiyetle düşünme becerisini gerçekten test eden kısıtlı sınav örnekleri bunlar. Bu problemlerin zor olduğuna dair çok iyi kanıtlarımız var; bir sürü insan çözmeye çalışıyor ve yarışıyor, bu da onlar için anlamlı. Geçmişte bir sürü şey bilen ama mutlaka derin düşünmeyen modeller için, bu gerçekten hedeflenmesi doğru bir kilometre taşı gibi görünüyordu.
Andrew Mayne: Anladığım kadarıyla IMO’da altın madalya düzeyinde puan alan model bir hesap makinesi ya da başka araçlar kullanmıyordu—tamamen muhakemeyle yaptı.
Jakub Pachocki: Doğru. Uluslararası Matematik Olimpiyatı için model başka araçlar kullanmadı. Ve yine: iki yıl önce ona iki tane dört basamaklı sayıyı çarpmasını isteseniz, başarısız olurdu. Bu tür bir yarışmada—elbette matematiğin sınırlı bir alanı içinde—mesele, bir formülü uygulamak değil, epey yaratıcı düşünmektir.
Andrew Mayne: Matematiğin dışına çıkınca zorlaşıyor ama. ‘Humanity’s Last Exam’ gibi güzel sınavlar icat edebilirsiniz; ama modeller belirli türden araç kullanımlarını öğrendikten sonra, bu problemleri nasıl çözeceklerini daha iyi buluyorlar. Hangi kıyas ölçütlerine ihtiyacımız olacak? Yeteneğe objektif ölçü koymak için siz neye bakıyorsunuz?
Szymon Sidor: Beni şaşırtan şeylerden biri, çalışma arkadaşımız Alana Makandu ile konuşmamdı. IMO’dan bahsettim—heyecanlıydım—o da ‘O ne?’ dedi. Bu benim için önemli bir andı. Bazı kıyas ölçütleri bize çok şey ifade ediyor çünkü bir balonun içinde yaşıyoruz; birçok insan için o kadar çekici değiller. Başka bir alanda çalışan sıradan biri—belki tarihe ya da dillere daha çok ilgi duyan—farklı metriklerle ilgilenir.
Szymon Sidor: Kusursuz bir metrik değil ama bizi dürüst tutan ve balondan çıkmamıza yardım eden bir şey de ChatGPT kullanımı. Herkes ChatGPT’yi her tür kullanım durumunda kullanıyor. Bunu metrik olarak kullanmanın tuzakları var, ama en azından bazı şeylere biz daha aşinayız—başkaları başka şeyleri takdir edebilir—sorununu azaltıyor; size çok geniş bir kapsama veriyor.
Andrew Mayne: Bunun içinde alt kümeler de var—GPT’ler inşa edenler ve daha karmaşık işler yapanlar. Modelin daha uzun süre muhakeme edeceğinden söz etmiştin; bu, yetenekleri değerlendirmek için ilginç bir yol gibi görünüyor.
Jakub Pachocki: Evet; yine de sadece geniş ChatGPT kullanımı ve benimsenmesine odaklanırsanız bu da bir meydan okuma. Bu henüz anlamlı ölçekte olmadı ama yakında olacak diye düşünüyorum: Tipik bir kullanıcının kendisi için ödemeye razı olacağından çok daha büyük hesaplama gücünü kullanarak pek çok insan için faydalı teknoloji eserleri üretmeliyiz. Bu, benim için çok önemli bir ilerleme ölçütü olacak.
Andrew Mayne: Bu kazanımlardan hangileri seni en çok şaşırttı?
Jakub Pachocki: Muhakeme modellerinin çalışmaya başladığını gördüğümüzde bu noktaya geleceğimizi öngörmüştük. Aynı zamanda, son dönemdeki sonuçlar seti çok etkileyici. Belki IMO beklediğimden biraz daha erken geldi. IMO’daki 6. Problem—her problem yaratıcı düşünce ve yeni içgörüler gerektirir ama 6. Problem tipik olarak çok kutunun dışında düşünmeyi gerektirir ve diğer problemlerin tipik alanlarının dışındadır. Geçmişte altın almamız—diğer problemleri çözmemiz—ile tüm problemleri çözmemizi, özellikle 6. Problemi çözmeyi, birbirinden ayıran bir sınır çizmiştik. Bu yüzden hem bizim hem de Google DeepMind’in aynı anda ‘Birden beşe kadar olan problemleri kusursuz çözdük ve 6. Problemde hiçbir ilerleme kaydetmedik’ demesini görmek bir bakıma komikti. Bu, meydan okumayı çok netleştiriyor.
Andrew Mayne: Açık model temelde ‘Sanırım bunu çözemem’ dedi. Denemedi bile ya da bunda sorun yaşadığını söyledi—doğru mu?
Jakub Pachocki: Model, problemde ilerleme kaydetmediğini doğru şekilde saptayabildi. Bu, bunu belirleyebilmek bakımından büyüleyici. İnsanlar halüsinasyondan söz ediyor; bence pek iyi anlaşılmış değil. Akışkan ve kristal zekâ ayrımı—bir modelin ne kadar bilgiye sahip olduğu ile problem çözme yeteneği arasındaki fark. ‘Buna yanıt veremeyeceğim’ diyebildiği noktaya gelmek ilginç.
Andrew Mayne: Japonya’daki bir canlı yayını sormam söylendi.
Jakub Pachocki: Son birkaç haftada, modellerimiz üç yarışmada inanılmaz iyi performans gösterdi: IOI ve IMO’nun yanı sıra, lise öğrencileriyle sınırlı olmayan herkese açık bir yarışma olan AtCoder. Japonya’da düzenlenen ama dünyaya açık, çok prestijli ve yüksek kaliteli bir yarışma. Bu yarışmada görevler daha uzun ufuklu sezgisel problemlerdi: tek bir problem veriliyor ve çözmek için 10 saatiniz var. Yarışmacılar, zor bir optimizasyon problemine en iyi yaklaşımı bulmak için yarışıyor. Tek bir doğru çözüm veya izlenecek tek bir kalıp yok; görevler son derece çeşitli ve 10 saat boyunca tek bir göreve odaklanıyorsunuz. Modelimizi bu yarışmaya soktuk. Bu benim için kişisel bir anlam taşıyordu: Ben geçmişte IOI gibi daha kısa, kapalı biçimli yarışmalara çok ilgiliydim; o sıralar birlikte çalıştığımız arkadaşım Shiho ise uzun süreli yarışmalarda müthişti. Birlikte çalışırken, benim türüm yarışmaların onununkinden çok önce otomatikleştirileceğiyle dalga geçerdi; çünkü uzun olanlar daha odaklı çalışma gerektirir. Meğerse bu Japonya’daki yarışmada Shiho, en üst adaylardan biriymiş ve ben modelimizin Shiho ile yarışını canlı yayında izledim. Sonunda, modelimiz ikinci oldu ve Shiho kazandı—böylece kendi öngörüsünün gerçekleşmesini tek başına engellemiş oldu.
Jakub Pachocki: Dikkatimi çeken bir şey oldu: Yarışmanın sonunda Shiho gerçekten çok yorgundu. Yarışmanın ortasında deneyimiyle ilgili onu röportaj yaptılar ve—parafraz ederek söylüyorum—temelde ‘Modelleriniz çok, çok kötü; uyumak istiyorum’ dedi. Bitap düşmüştü.
Andrew Mayne: ‘Duvar’a çarpma’dan söz edildiğini duyduk. Muhakeme adeta birdenbire ortaya çıktı. İpuçları vardı—bazı makaleler—ama insanlar çizgiyi pek çekmemişti. Sonra o1 modeli geldi ve bir modele iç monolog tanıyabileceğinizi, kendi kendine konuşup meseleyi çözebileceğini gösterdi. Bu bizi AGI’ye götürmeye yeter mi, yoksa başka atılımlar da mı gerek?
Szymon Sidor: Şunu belirtmem gerek ki ekip bu konuda olağanüstü çalıştı. Fikir basit gibi geliyor—‘daha uzun bir düşünce zinciri kullan’—ama bunu çalışır kılmak çok zor kazanıldı. İlk çalıştığını fark ettiğimizde—bu modelleri eğitebileceğimizi, onlara daha çok veri verebileceğimizi ve daha iyi hale geldiklerini gördüğümüzde—bu en sarsıcı anlardan biriydi.
Szymon Sidor: ‘Örgüt olarak inanılmaz hızlı ilerlemeye hazır mıyız?’ sorusunu çok ciddiyetle sormaya başladık. Saat 23.00 civarı bir akşamı hatırlıyorum; Sam ve Mira ile hatta, bunu sindirmeye çalışıyorduk. Sonuçlar bizi biraz ürkütmüştü. Bazen böyle olur—tempo hızlıdır. İnsanlar, altı hafta bir şey olmazsa yavaşladı diye şaka yapar, ama yıl bazında inanılmaz. Dünyaya o1 yaklaşımı, mevcut altyapıdan çok daha fazla yetenek çıkarmanın temel bir yeni yolu gibi göründü.
Andrew Mayne: Sence bir sonraki atılımlar nerede olacak?
Jakub Pachocki: Hafife almamaya çalıştığımız şeylerden biri ölçeklemenin önemi. Muhakeme modellerine bakarken bile, önceki ön eğitim (pre-training) ölçekleme paradigmasının ortadan kaybolmadığını görüyoruz. Bunlar bileşik etki yapacak. Ayrıca yeni yönler var: modellerin planlayıp muhakeme edebileceği ufku uzatmak. Hesaplama harcaması (compute spend) açısından bakarsanız, GPT-4’ün her cevap için bir miktar hesaplama yaptığı yerden, diyelim ki daha yetenekli bir modelin cevap başına belki 10x veya 20x daha fazla hesaplama kullandığı—önemsiz olmasa da bazı açılardan o kadar da büyük olmayan—bir yere geldik ve çok daha iyi cevaplar üretiyoruz. Pek çok insan için gerçekten önemli olan problemler—örneğin tıbbi araştırma sorularında ilerleme ya da bir sonraki nesil modelleri geliştirme—için harcamaya razı olacağınız miktarlar kıyas kabul etmeyecek kadar daha büyük. Model sürekliliği (persistence) ve tek bir odaklı problem üzerinde çok uzun süre çalışabilme yeteneği, oldukça net bir sonraki adım.
Andrew Mayne: AGI’nin pratik sonuçlarını tipik bir ChatGPT kullanıcısı için nasıl anlatırsın? Birkaç yıl sonra—beş yıl sonra—deneyimleri nasıl olacak? Beş yıl önce GPT-3 çıktı; sanki dün gibi. AGI-benzeri bir model neler yapabilir?
Jakub Pachocki: Araştırmayı otomatikleştirmekten bahsetmiştim. Gözümdeki resim, çok yetenekli araştırmacı ve mühendisten oluşan, büyük ölçüde otomatik bir şirket. Dünya ile pek çok yoldan etkileşime girecek; siyah kutu olmayacak. İnsanlarla konuşacak, girdiler alacak, deneyler yapacak. Yeni teknolojiler ve diğer eserler—kod tabanları, tasarımlar—geliştirme potansiyeline sahip olmak, teknik ilerleme hızını radikal biçimde hızlandırabilir. Bunu hissedeceğiz ve teknik ile toplumsal açıdan işi doğru yapmak için çok emek vermemiz gerekecek. Etkileşim kurduğumuz arayüzlerde de büyük ilerleme beklemeliyiz. Sohbet epey insansı gelebiliyor; ona karşı bağlar kurabiliyoruz. Daha kalıcı oldukça ve kendini farklı biçim ve mecralarda ifade edebilir hale geldikçe bu etkiler güçlenecek ve bu, büyük ve önemli bir tartışma olacak.
Andrew Mayne: ChatGPT’de takvimimi ve Gmail’imi okumasına yeni erişim aldım ve ne kadar ilerlediğimizi fark ettim. Buna artık heyecanlanıyorum; gidip birine Ewok fan fiction yazmaya başlayacağından korkmuyorum. Güzel bir güven eşiğini geçtik. Zor ödünleşmeler var: modele verilerinize erişim vermenin açık bir ekonomik ve kişisel değeri var, ama henüz modellerin, birilerinin onları sömürmeye çalışmasından büsbütün korunacağı bir sağlamlık eşiğinde değiliz.
Jakub Pachocki: Bu, alan olarak üzerinde tekrarlayıp durmamız gerekecek büyük bir problem.
Andrew Mayne: Bugün lisede olan iki versiyonunuza ne söylerdiniz? Eski sınıfınızı ziyaret ediyor olsanız, neler söylerdiniz? Ne tavsiye ederdiniz?
Szymon Sidor: Bitcoin’e yatırım yapın.
Andrew Mayne: Hayır, bugün—2025’te—bir lise öğrencisine ne söylerdiniz?
Jakub Pachocki: Kesinlikle kod yazmayı öğrenmelisiniz. Prim yapan—ve yapmaya devam edecek—becerilerden biri, karmaşık problemleri parçalara ayırabilen yapılı bir zekâya sahip olmak. Gelecekte bu her zaman programlama olmayabilir ama programlama bu beceriyi edinmenin gayet iyi bir yolu. Çok düşünmenizi gerektiren diğer alanlar da öyle. İnsanların size ‘Kod yazmayı öğrenmeyin’ demesine izin vermeyin.
Andrew Mayne: Ben hayatımın geç döneminde kod yazmayı öğrendim ve böylece OpenAI’de mühendis olarak çalıştım. Bir sistem bir şeyi yapabiliyor diye nasıl çalıştığını bilmek istemeyeceğiniz anlamına gelmez. Bir görevi parçalarına ayırmayı anlamak, dil ve araçları daha iyi şeyler yapmak için kullanmanıza yardım eder. O köprüleri kuran insanlar avantajlıdır. ‘Kod yazmayı öğrenmeyin’ sözünü duyunca, aerodinamiği anlamayan bir pilot istediğinizi söylemek gibi geliyor—pek mantıklı değil.
Jakub Pachocki: Lisede nasıl düşündüğümü düşününce, kaç tane ‘varsayılan kısıt’ın aslında biraz derin düşününce orada olmadığını görmek inanılmaz. İlk aydınlanmam, bilgisayar bilimine gerçekten tutkuluysam, okulda diğer 12 derse biraz daha az zaman ayırma pahasına buna daha fazla zaman ayırabileceğimdi. Sonra, ABD’de okuyabileceğimi fark etmek için başka bir aydınlanma gerekti—bu eylem uzayımın içindeydi. Daha sonra Silikon Vadisi’nde vakit geçirmek ve insanların büyük sorunlara büyük bir ihtirasla saldırmaya ne kadar istekli olduklarını ve dünyada anlamlı, olumlu değişim yaratabileceğinize dair inancı görmek inanılmaz derecede ilham vericiydi. Bu toplulukta değer verdiğim şeylerden biri bu.
Andrew Mayne: Seni etkileyen bir kitap var mı?
Jakub Pachocki: Birkaç tane. Şimdi düşününce komik—o zamanlar noktaları birleştirmemiştim—ama babam ben yaklaşık 15 yaşındayken ve ne yapmak istediğimden emin değilken bana bir kitap verdi: Paul Graham’ın ‘Hackers and Painters’ kitabının Lehçe çevirisi. Bu ilham vericiydi—yine bu topluluğun bir parçası.
Andrew Mayne: ‘Büyük hayal kurup bir şeyleri hayata geçirmek normaldir’ mesajını duymak faydalı. Bunu ne kadar çok insan fark ederse dünya o kadar iyi olur. Szymon, seni etkileyen kitap, film ya da TV programı?
Szymon Sidor: O derin cevaptan sonra benimki aptalca kaçacak. ‘Iron Man’i izledim ve beni robotikte doktora yapmaya itti.
Andrew Mayne: Harika bir cevap. Andy Weir’ın ‘The Martian’ı bazı insanlar için öyle oldu. NASA’da bir bilim insanıyla—bir botanikçiyle—tanıştım; kitabı okumuş, atmosfer fiziğini didiklemişti, sonra ‘Zaten bu yüzden buradayım’ dedi.
Szymon Sidor: Aptalca olan kısım şu: Robotik üzerinde çalışmaya başlayınca robotların ne kadar kötü olduğuna hayal kırıklığına uğradım. Filmin film olabileceği aklıma gelmemişti. Tüm deneyim benim için muhtemelen kötü olacaktı; neyse ki derin öğrenmeyle ilgilenen bir arkadaşla tanıştım. O zamanlar tüm makine öğrenimini hype sanıyordum ama ilginç bir sistemler problemiydi. Sonra birdenbire—‘birdenbire’ dediğim için DeepMind’deki bazı arkadaşları kızdıracağım ama—AlphaGo çıktı. Elbette yılların ürünüydü ve ikimizi de çok etkiledi. O andan sonra ciddiye almamak zordu.
Jakub Pachocki: Derin öğrenmenin modadan ibaret olmayan bir şey olduğuna ikna olmam zaman aldı. Altta yatan optimizasyonu gerçekten anlamıyoruz ve araştırmamızın hikâyesi biraz da bu oldu: nasıl çalıştığına dair ilerleme kaydetmeye çalışmak. Bir bakıma fiziksel bir olguyu incelemek gibi; klasik eğitimli bir bilgisayar bilimci için bunu kabullenmek tuhaftı. AlphaGo’dan önce ‘ilkesel dışbükey optimizasyonu ölçeklemek’ hakkında konuştuğumu hatırlıyorum.
Andrew Mayne: AlphaGo ilginçti: önce ‘Vay, oyunları izleyip Go’yu çözdü’ dedik; sonra AlphaGo Zero kendi kendine öğrendi ve ‘Tamam, oyun bitti—burada bir yörünge var’ oldu. ‘Iron Man’i izlemeseydin—belki ‘Thor’u izleseydin—kim bilir işler nasıl gelişirdi.
Szymon Sidor: Keşke matematik okusaydım; belki daha faydalı olurdu.
Andrew Mayne: Ne?
Szymon Sidor: Matematik—matematik ya da kuramsal bilgisayar bilimi. Her ikisi de. Muhtemelen fizik.
Andrew Mayne: Fizik?
Szymon Sidor: Evet.
Andrew Mayne: Ben sihirbaz olarak başladım—bilmiyorum, biliyor musunuz. Kendi reality TV programım vardı. Çok tuhaf bir yoldan gelip yine de buraya varabiliyorsunuz.
Andrew Mayne: Jakub, Szymon, ikinizle konuşmak tam bir zevkti. Umarım tekrar buluşur, ‘birdenbire’ çıkmış gibi görünen, aslında gizlice üzerinde çalıştığınız bir sonraki büyük atılımı konuşuruz.
Jakub Pachocki: Teşekkürler, Andrew.
Szymon Sidor: Teşekkür ederim.
Andrew Mayne: Hello, I’m Andrew Mayne, and this is the OpenAI podcast. Today our guests are OpenAI’s Chief Scientist, Jakub Pachocki, and Szymon Sidor. We’re going to talk about measuring AI progress, how you determine AGI, and where the next breakthrough might come from.
Andrew Mayne: The model was able to correctly identify that it didn’t make progress on the problem. We started asking, very, very seriously, the question: are we ready, as an organization, for incredibly fast-paced progress when we think about how we shape our research program at OpenAI? We seek to create intelligence that’s very general.
Andrew Mayne: I want to first start off by understanding your roles. So, Jakub, you’re the chief researcher—chief scientist at OpenAI?
Jakub Pachocki: Chief scientist.
Andrew Mayne: Yes. Okay. What does ‘chief scientist’ mean?
Jakub Pachocki: The primary thing I’m responsible for is setting the research road map for the company—deciding what technical path we’re going to bet on and what the underlying long-term research is that we’re going to pursue.
Andrew Mayne: How about you, Szymon? What do you do?
Szymon Sidor: Random things.
Andrew Mayne: Random things. Okay.
Szymon Sidor: I mostly do IC work. I try to—maybe with a sprinkle of leadership somewhere in there—do whatever is most useful.
Andrew Mayne: Now, you two knew each other before working at OpenAI, right?
Szymon Sidor: Yeah, we went to the same high school.
Andrew Mayne: Same high school—yeah. Were you guys friends?
Szymon Sidor: I think we became best friends after we left. Coming to the U.S. is the kind of emotional experience that forms bonds. In high school, we were more like colleagues.
Andrew Mayne: What kind of high school produces guys like you?
Jakub Pachocki: We went to a high school in Poland. We were both drawn there by a computer science teacher, Mr. Ryszard Subarowski, who had a great track record—even before we went there—of bringing up computer scientists and programmers, with a big focus on programming competitions and pursuing excellence in that one field. That was a very formative experience and he was a great mentor for us.
Szymon Sidor: Definitely. The curriculum went really deep into programming—it went way beyond a typical high school curriculum. There was graph theory, matrices, and all sorts of material like that. I actually hope that with ChatGPT it’s a little easier now for people to do these kinds of deep dives, because without the right mentor and a lot of work, it’s hard to replicate that experience.
Andrew Mayne: I’ve been using it to explain things. There’s the Monty Hall problem where you have to choose a door, and you can go into ChatGPT and say, ‘Make a graphic interactive version of this,’ and suddenly you can see it. It can show you different solutions depending on what you do. I’m excited about the ability not just to explain in text, but to build multimedia things. And it gets into an area where there isn’t really a measure for that—you know it’s a use case that didn’t exist before. We talk about AGI, but we have very loose definitions, and I’d love to hear how you’d describe it both from a technical perspective and for a layperson.
Jakub Pachocki: Maybe to address the point about teaching: better explanations of concepts and teaching chosen methods are a powerful use of ChatGPT, and I think they work well in the hands of a teacher like our Mr. Subarowski. At the same time, the thing he provided was emotional support and space, which I think will be hard for AI to do alone.
Andrew Mayne: That’s a great point. It gets lost when people say, ‘AI will replace education.’ For me, I had teachers whose facts weren’t always right, but their heart was there, they cared, and they answered questions. These tools are companions to that, and a teacher using these tools can be a more capable teacher.
Jakub Pachocki: Yeah.
Andrew Mayne: On the subject of AGI, give me your technical definition—actually, not the technical one first. How would you describe it to a younger sibling?
Jakub Pachocki: A few years ago, when we would talk about AGI, it felt like deep-learning technology had incredible promise, but the concept still felt abstract and far away. Whether you talked about human-level intelligence, the ability to converse naturally, the ability to solve math problems, or to pursue research—those all felt like the same space. As technology has progressed, we now see these are quite distinct capabilities. We’re clearly at the point where AI is able to converse naturally on a wide range of topics. It’s able to solve math problems. Getting gold medal level at the IMO is something we’ve long discussed as a milestone on the path to AGI—and that happened. Solving all the problems on the national math league is actually a little bit harder, and that’s another milestone on the path there. Increasingly, we see that pointwise measures are less adequate, so we turn to thinking about the actual impact in the world.
Jakub Pachocki: For me, the place where AI progress impacts the world most meaningfully is automating the discovery and production of new technology. We tend to associate new ideas—fundamental technological progress—with human ingenuity. We measure progress by major milestone inventions and technological revolutions. It’s hard to internalize, but it’s possible to automate most of this process. It’s possible to have a big computer that comes up with ideas that fundamentally change our understanding of the world, and I don’t think that’s far away. So I think about what separates us from that, and what the consequences of such technology are.
Andrew Mayne: I just ordered a little Mac Studio because I want to take the open-source model GPT-OS and let it run non-stop. The idea of letting it generate and do stuff 24/7 is fascinating. But you’re talking about a scale that basically automates science at a huge level. What kinds of discoveries do you think we might see first?
Jakub Pachocki: When we shape our research program at OpenAI, we seek to create intelligence that is very general. We drive towards the automated researcher as a priority, but we don’t think of it as taking a few specific domains and deploying there. That’s a way to make faster pointwise progress, but the potential for the really big discoveries and the most meaningful technological advancements comes from generality. That said, technology is easier to apply in some domains than others—especially where a large amount of reasoning combines with domain knowledge and intuition. We see incredible results in medicine, which is very encouraging and gives me high hopes. Naturally, as a company of AI researchers, we think a lot about automating our own work. If AI can reach a point where you can automate AI research, that’s probably a very important thing to automate, and similarly, automating research on AI alignment and safety.
Szymon Sidor: I’m impressed by the IMO results. In the past, when we were talking about the IMO with Jakub a few years ago, we were still trying to figure out what our definition of AGI might be. One concept we considered was solving all the problems on the Math Olympiad. Why did that feel appropriate? If you have a model with superior mathematical reasoning, it should be able to disrupt a bunch of different domains that can be mathematically modeled.
Szymon Sidor: Maybe this podcast is a good opportunity to share a bit of the inside perspective. I’m astounded by the progress. Sometimes I see headlines like, ‘The economic impact of AI is only 3% or 5%,’ with comments like, ‘AI is slowing down,’ or, ‘People are overhyping AI; it’s only 3%.’ When I see that, I remember 10 years ago working on NLP with deep learning, and back then it didn’t really work. I remember Jakub once tested a sentiment-detection model we were working on: ‘This movie is bad’ → negative, ‘This movie is good’ → positive, then ‘This movie is not bad’ and the model said negative. That was 10 years ago. Since then, we slowly started solving tasks like that; then tasks like deciding if a word is a noun or a verb (the ‘sentiment neuron’ era). Then we had GPT-1, GPT-2 started producing paragraphs of text that made sense—that was such a breakthrough. Then GPT-3, GPT-4. GPT-4 was my personal AGI moment, because it would sometimes say things that surprised me. Could a model actually surprise me?
Szymon Sidor: Back then, ChatGPT for my personal use felt like a nuanced, slightly better search engine—what’s the big deal? Then we got to deep research, and it could answer questions while rarely making things up. That felt useful. Finally, now we have models that can compete in programming competitions—which was hard-earned for me personally, and even more so for Jakub. The pace of progress, from the perspective of someone working on this technology, is absolutely amazing. If today it’s 3%, 10 years ago it would have been something like 0.00001%. Those numbers need perspective. There’s no reason not to believe that in a year it could be 10%, in two years 20%, and so on.
Andrew Mayne: I’ve heard it said that if you look at a graph of the economy from the early 90s onward and try to ‘point’ to the internet happening, you can’t. There’s no point where you go, ‘Oh, Tim Berners-Lee announced this,’ and see a kink in the curve. AI is a lot like that. Our measures are hard; it’s hard to know who’s using it and how. If you’ve been following it for a while, you remember training a very simple next-character predictor on your own computer—terrible. Then sentiment analysis. You play with BERT, it’s… fine. GPT-2 comes out and you read every output and think, something’s going on. That’s how I ended up working at OpenAI; I was obsessive about it. With access to GPT-3 I kept saying, this path is moving forward. Now, if six weeks go by and a benchmark isn’t broken, people say, ‘We hit the wall.’ But benchmarks sometimes show modest improvements; some have problems—wrong answers that make it impossible to get 100% if you answer correctly. Internally we talk about ‘saturation.’ Do you want to talk about that?
Jakub Pachocki: There are a few issues we’re hitting with benchmarks. A clear one is saturation: models genuinely reaching a point where, for standardized measurements of intelligence or ability, they’re at human level for a lot of them. If you can perform among the top competitors in very hard high-school competitions with the best people from around the world, it becomes hard to keep using very constrained measurements. Previously, in the GPT-1/-2/-3/-4 scaling paradigm, benchmarks were measuring the rising tide. Now, the field has developed more data-efficient ways to train for specific abilities. You can train models that are disproportionately good at math compared to their ability to write, for example; they’ll do better on math benchmarks, but that’s no longer representative of their overall intelligence across topics. These issues combined suggest we really have to think about the models’ reward utility and, especially, their ability to discover new insights.
Andrew Mayne: You can build a model that’s a really good test-taker, but it may not be useful for work. Ideally, your model should score well on tests, but just because it got certain scores doesn’t mean you’ll find it personally useful. That’s the challenge now when people ask, ‘Is a model good or bad?’ It’s like making a blanket assessment when there are a hundred different use cases—maybe it’s great at creative writing and bad at math, or vice versa. With the IMO and the International Olympiad in Informatics, why are those metrics important? Why put models into human-level competitions?
Jakub Pachocki: We’ve been excited about competitions like the IMO and the IOI because they’re constrained tests that don’t require much knowledge but really test your ability to think about a problem hard for an hour or two or three. We have good evidence these problems are hard; many people try to solve them and compete, and it matters to them. For models that excelled at knowing a lot of things but not necessarily thinking hard in the past, that seemed like the right milestone to target.
Andrew Mayne: My understanding is that the model that scored at gold-medal level on the IMO wasn’t using a calculator or other tools—it did it purely through reasoning.
Jakub Pachocki: That’s right. For the International Mathematical Olympiad, the model was not using other tools. And again: two years ago, you could ask it to multiply two four-digit numbers and it would fail. For this kind of contest—of course within a limited domain of math—it’s about fairly creative thinking, not applying a formula.
Andrew Mayne: Once you move outside math, it gets harder. You can come up with things like Humanity’s Last Exam, which is a neat test, but after models learn certain kinds of tool use, they figure out how to solve those problems better. What benchmarks are we going to need? What do you look at to get an objective measure of capability?
Szymon Sidor: One thing that surprised me was talking to our coworker Alana Makandu. I told her about the IMO—I was excited—and she said, ‘What’s that?’ That was an important moment. Some benchmarks matter a lot to us because we live in a bubble; for many people they’re not as compelling. For an average person working in another field—maybe more interested in history or languages—different metrics matter.
Szymon Sidor: One thing that’s not a perfect metric but keeps us honest and helps us escape the bubble is ChatGPT usage. Everybody uses ChatGPT for all sorts of use cases. There are pitfalls in using that as a metric, but at least it avoids the problem that we’re more familiar with some things than others; it gives you wide coverage.
Andrew Mayne: Within that, you have subsets—people building GPTs and doing more complicated stuff. You mentioned that the model will reason longer, and that seems like an interesting way to evaluate capabilities.
Jakub Pachocki: Yes, though it’s also a challenge if you focus only on broad ChatGPT usage and adoption as the metric of progress. This hasn’t happened at a meaningful extent yet, but I think it will soon: we should be able to use vastly more compute than a typical user would be willing to buy for themselves, to produce technology artifacts useful to many people. That, for me, will be an important measure of progress.
Andrew Mayne: Which of these wins were the most surprising to you?
Jakub Pachocki: We anticipated getting to this point when we saw the reasoning models starting to work. At the same time, the recent set of results is very impressive. Maybe IMO came a little sooner than I expected. Problem 6 at the IMO—every problem requires creative thought and new insight, but Problem 6 typically requires very out-of-the-box thinking and is outside the typical domains of the other problems. In the past, we drew a boundary between getting gold—solving the other problems—and actually solving all the problems, in particular Problem 6. So it was pretty hilarious in some way to see ourselves and Google DeepMind at the same time saying, ‘We solved problems one through five perfectly, and we didn’t make any progress on Problem 6.’ That clarifies the challenge.
Andrew Mayne: The open model basically said, ‘I don’t think I can solve this.’ It didn’t even try, or said it had a problem with it—was that correct?
Jakub Pachocki: The model was able to correctly identify that it didn’t make progress on the problem. That’s fascinating—being able to determine that. People talk about hallucination, which is poorly understood. There’s fluid vs. crystalline thinking—how much knowledge a model has vs. problem-solving capability. When it’s able to say, ‘I won’t be able to answer this,’ that’s an interesting point to reach.
Andrew Mayne: I’ve been told to ask about a live stream in Japan.
Jakub Pachocki: In the past few weeks, our models performed incredibly well in three competitions: the IOI and the IMO, and also a competition open to everyone (not just high-schoolers) called AtCoder. It’s a very prestigious, high-quality contest organized in Japan but open worldwide. In this particular contest the tasks were longer-horizon heuristic problems: you’re given a single problem and you have 10 hours to solve it. Competitors race to figure out the best approach to a difficult optimization problem. There isn’t a single correct solution or pattern to follow; the tasks are extremely diverse and you focus on one task for 10 hours. We entered our model. This had personal significance to me: I used to be very engaged in shorter, closed-form contests like IOI, and my friend Shiho—who also worked at the time—excelled at the long-duration contests. When we worked together he would mock me that my sort of contest would be automated long before his, because the long ones require more focused work. It turns out, in this contest in Japan, Shiho was one of the top contenders, and I watched a live stream of our model racing with Shiho. In the end, our model got second place and Shiho won—so he alone stood in the way of his prediction not coming true.
Jakub Pachocki: One thing that stood out: at the end, Shiho was really tired. They interviewed him about the experience mid-competition and—paraphrasing—he basically said our models were very, very bad and he wanted to go to sleep. He was exhausted.
Andrew Mayne: We’ve heard talk about ‘the wall.’ Reasoning kind of came out of nowhere. There were hints—some papers—but people hadn’t drawn the line. Then the o1 model comes out and shows that you can let a model have an inner monologue, talk to itself, and solve things through. Is that enough to take us to AGI, or are other breakthroughs needed?
Szymon Sidor: I need to point out the team worked extremely hard on this. It feels like a simple idea—‘just use a longer chain of thought’—but making it work was hard-earned. When we first noticed it working—when we saw that we could train these models, give them more data, and they’d get better—that was one of the most shocking moments.
Szymon Sidor: We started asking, very seriously, are we ready as an organization for incredibly fast-paced progress? I remember one evening around 11 p.m., on the line with Sam and Mira, trying to process this. We were a little freaked out by the results. Sometimes that happens—the pace is fast. People joke that if nothing happens for six weeks, progress has slowed, but year over year it’s dramatic. To the world, the o1 approach looked like a fundamental new way to get much more capability out of existing infrastructure.
Andrew Mayne: Where do you think the next breakthroughs will happen?
Jakub Pachocki: One thing we try not to underestimate is the importance of scaling. Even as we look at reasoning models, it’s not like the previous scaling paradigm of pre-training has vanished. These things will compound. There are also new directions: extending the horizon over which models can plan and reason. From the perspective of compute spend, we went from GPT-4 doing some amount of compute for every answer to, say, a more capable model using maybe 10x or 20x more compute per answer—not trivial, but in some ways not that large—and producing much better answers. On problems that actually matter to a lot of people—like progress on a medical research question, or developing the next generation of models—the amounts you’d be willing to spend are incomparably larger. The question of model persistence and the ability to work for a very long time on a focused problem is a pretty clear next step.
Andrew Mayne: How would you put the practical implications of AGI for a typical ChatGPT user? What will their experience be like in a few years—five years from now? Five years ago GPT-3 came out; that feels like a blur. What would an AGI-like model be capable of?
Jakub Pachocki: I talked about automating research. My picture is a company of very capable researchers and engineers that is largely automated. It will interface with the world in many ways; it won’t be a black box. It will talk to people, take inputs, run experiments. Having this potential for developing new technology and other artifacts—codebases, designs—can radically accelerate the pace of technical progress. We’ll feel that, and we need to do a lot of work to get it right, technically and societally. We should also expect a lot of progress in the interfaces we interact with. Chat can feel quite human-like; we can form attachments to it. As it becomes more persistent and capable of expressing itself in different forms and media, those effects will become stronger, and that will become a big and important conversation.
Andrew Mayne: I just got access in ChatGPT to have it read my calendar and Gmail, and I realize how far we’ve come. I’m excited about that now; I’m not terrified it’s going to start writing Ewok fan fiction to somebody. We’ve crossed a neat trust threshold. There are tough trade-offs: there’s clear economic and personal value in letting the model access your data, but we’re not yet at the robustness threshold where we can fully trust models not to be exploited by someone trying to exploit them.
Jakub Pachocki: It’s a big problem we, as a field, will have to iterate on.
Andrew Mayne: What would you tell the two versions of you today back in high school? If you were visiting your old classroom, what would you say? What advice would you give?
Szymon Sidor: Invest in Bitcoin.
Andrew Mayne: No, I mean today—today in 2025—what would you tell a high-school student?
Jakub Pachocki: You should absolutely learn to code. A skill that is at a premium—and will continue to be—is having a structured intellect that can break complicated problems into pieces. That might not always be programming in the future, but programming is a fine way to acquire that skill. So are other domains where you need to think a lot. Don’t let people tell you not to learn to code.
Andrew Mayne: I learned to code late in life, and that’s how I ended up working at OpenAI as an engineer. Just because a system can do the thing doesn’t mean you don’t want to know how it works. Understanding how to break down a task helps you use language and tools to do better things. People who bridge those gaps are at an advantage. When I hear ‘Don’t learn to code,’ it’s like saying you want an airplane pilot who doesn’t understand aerodynamics—it doesn’t make sense.
Jakub Pachocki: Thinking about how I thought in high school, it’s incredible how many perceived constraints aren’t really there when you think hard about them. The first revelation for me was, if I’m passionate about computer science, I can spend more time on it at the cost of spending a bit less time on the other 12 subjects in school. Then, it took another revelation to realize I could study in the USA—that’s within my action space. Later, spending time in Silicon Valley and seeing how people are willing to attack big problems with ambition, and the belief that you can make a meaningful positive change in the world—that’s been incredibly inspiring. It’s something I cherish about this community.
Andrew Mayne: Is there a book that inspired you?
Jakub Pachocki: A couple. It’s hilarious thinking about it now—I didn’t connect the dots then—but my dad gave me a book when I was about 15 and unsure what I wanted to do: a Polish translation of ‘Hackers and Painters’ by Paul Graham. That was inspiring—again, part of this community.
Andrew Mayne: Hearing the message, ‘It’s okay to dream big and make things happen,’ is helpful. The more people realize that, the better the world gets to be. Szymon, any book or movie or TV show that influenced you?
Szymon Sidor: I have a stupid answer after that profound one. I watched ‘Iron Man,’ and it inspired me to start a PhD in robotics.
Andrew Mayne: That’s a great answer. ‘The Martian’ by Andy Weir did that for some people. I met a NASA scientist—a botanist—who read it, nitpicked the physics, and then said, ‘That’s why I’m here.’
Szymon Sidor: The stupid part was that when I started working on robotics, I was disappointed at how bad the robots were. It didn’t occur to me that maybe the movie is a movie. The whole experience would have been kind of bad for me if not for the fact that I met a friend who was into deep learning. At the time, I thought all of machine learning was hype, but it was an interesting systems problem. Then, out of nowhere—though I’m sure I’ll frustrate some DeepMind folks by saying ‘out of nowhere’—AlphaGo came out. I’m sure it was years in the making, and it was very inspiring to both of us. Since then, it was hard not to take it seriously.
Jakub Pachocki: It took me a while to become convinced that deep learning was more than a fad. We don’t really understand the underlying optimization, and that’s been the story of our research: trying to make progress on how it really works. It’s like studying a physical phenomenon, and to a classically trained computer scientist that was weird to accept. I remember talking about scaling up principled convex optimization before AlphaGo.
Andrew Mayne: AlphaGo was interesting: first, ‘Oh cool, it solved Go by watching games,’ then AlphaGo Zero self-taught and it was like, ‘Game over—there’s a trajectory here.’ If you hadn’t watched ‘Iron Man’—maybe ‘Thor’ instead—who knows how things would have turned out.
Szymon Sidor: I kind of wish I’d studied maths instead; it might have been more useful.
Andrew Mayne: Study what?
Szymon Sidor: Maths—mathematics or theoretical computer science. Either of those. Physics, probably.
Andrew Mayne: Physics?
Szymon Sidor: Yeah.
Andrew Mayne: I started off as a magician—I don’t know if you know that. I had my own reality TV show. You can have a very strange path and still end up here.
Andrew Mayne: Jakub, Szymon, it’s been an absolute pleasure to talk to you both. I hope we can meet again and talk about the next big breakthrough you’ve been secretly working on that will come ‘out of nowhere’ and look like an overnight thing.
Jakub Pachocki: Thanks, Andrew.
Szymon Sidor: Thank you.






























Geri bildirim: Muhaberat Evirileri — özel sayfa | 🦋🤖 YERSİZ ŞEYLER