Yazılımda son dönemin en baştan çıkarıcı hissi, elli satırlık kalıp kodun saniyeler içinde ekranda belirmesi. Bu anlık üretim, yüksek hızda ilerliyormuşuz izlenimi yaratıyor ve videonun açılış grafiği de bunu sayıya döküyor: makine öğrenmesi araştırmacıları yüzde 38, ekonomistler yüzde 39, geliştiricilerin kendisi yüzde 24 hızlanma bekliyor. Oysa METR'in rastgele kontrollü deneyi tabloyu tersine çevirdi; yapay zeka desteğiyle yapılan işler ortalama yüzde 19 daha uzun sürdü. Açıklama tek bir bilişsel kestirmeye dayanıyor: geliştirici, modelle taslak üretirken geçen birkaç saniyeyi net hatırlıyor ama ardından gelen kenar durumları ayıklama, halüsinasyonları ayıklama ve bozulan testleri onarma için harcanan otuz dakikayı sistematik biçimde küçümsüyor. Akış hissi ya da yazma hızı üzerinden yapılan öz değerlendirme, karmaşık ortamlarda asıl verimlilik kaybını perdeliyor.
Deney, erken 2025 döneminin en zorlu zemininde kurgulandı. Şubat ile Haziran 2025 arasında, kendi depolarında ortalama beş yıl geçmişi olan 16 kıdemli bakımcı, toplam 246 gerçek birikmiş iş kalemini üstlendi. Odak, scikit-learn ve transformers benzeri 14 gösterge niteliğindeki olgun açık kaynak deposuydu; her biri ortalama bir milyon satırın üzerinde, on yıla yakın geçmişe sahip, yıldız sayısı 22 bin civarında projeler. Her iş kalemi, geliştirici zorluk tahminini yaptıktan sonra yazı tura ile yapay zeka serbest ya da yasak koşuluna atandı; serbest koşulda ağırlıkla Cursor Pro ve Claude 3.5 ile 3.7 kullanıldı. Analiz, görev zorluğundaki büyük varyansı yutmak için bu ön tahminleri kontrol eden log-doğrusal bir regresyonla yapıldı; beş dakikalık düzeltme ile on saatlik mimari değişim arasındaki fark böylece emildi ve yüzde 19'luk yavaşlama nedensel etki olarak sabit kaldı. Deneysel gürültüyü elemek için ek kontroller de var: katılımcıların yüzde 44'ü zaten Cursor kullanıyordu ve ekran kayıtları serbest koşulda araçların yüzde 83'ün üzerinde kullanıldığını gösterdi, yani sonuç yabancılıktan ibaret değil.
Sonucun en sarsıcı kısmı algı ile gerçek arasındaki ısrarlı uyumsuzluk. Katılımcılar başlamadan önce yapay zekanın kendilerini yüzde 24 hızlandıracağını öngördü; yüzlerce saatlik deneyimden sonra bile geriye dönük tahminleri yüzde 20 hızlanma yönünde kaldı. Gerçekte ise yüzde 19 yavaşlama ölçüldü. Dış uzmanlar daha da iyimserdi: ekonomistler yüzde 39, makine öğrenmesi uzmanları yüzde 38 kısalma bekledi. Bu tablo, geliştiricilerin göreceli zorluğu iyi kestirdiğini de gizlemiyor; ön tahmin ile gerçekleşen süre arasındaki korelasyon 0,59 ile 0,64 bandında, yani ne kadar süreceğini biliyorlar ama yapay zekanın etkisinin işaretini ters görüyorlar. Beklenti hatası bireysel değil, kolektif ve deneyim sonrası bile dirençli.
Zamanın nereye gittiğini anlamak için ekip 143 saatlik ekran kaydını yaklaşık 10 saniyelik çözünürlükte elle etiketledi; bu toplam sürenin yüzde 29'una denk düşüyor. Yapay zekasız tabanda uzman, zamanının yüzde 41'ini aktif kod yazmaya, yüzde 36'sını sistemi anlamak için belge ve kod okumaya ayırıyor. Yapay zekalı koşulda bu taban küçülüyor: sürenin yüzde 6'sı istem oluşturmaya, yüzde 4'ü modelin üretimini beklemeye, ilave yüzde 9'u ise makine çıktısını gözden geçirme, hata ayıklama ve düzeltmeye kayıyor. Yükün kaynağı güvenilirlik: geliştiriciler önerilerin yüzde 56'sını ya büyük ölçüde elden geçirmek ya da tamamen reddetmek zorunda kaldı, yüzde 44'ten azı olduğu gibi kabul gördü ve katılımcıların yüzde 75'i üretilen her satırı okuduğunu söyledi. Kodlama süresindeki küçük kazanç, denetleme ve düzeltme döngüsünde fazlasıyla geri alınıyor; bilişsel çaba yapıcı sistem düşüncesinden yorucu denetçiliğe taşınıyor.
Olgun depolar neden bu kadar dirençli sorusu videonun kilit argümanı. Bu ölçekte mühendislik yazmaktan çok okumak: karmaşık mimarileri taramak, alt sistemler arasındaki narin bağları görmek ve yapıyı ayakta tutan yazılı olmayan değişmezleri sağlamak. Bu projeler, bakımcının zihninde yaşayan ama modelin doğrudan okuyamadığı örtük depo bağlamına, üslup deyişlerine ve alana özgü kurallara dayanıyor. Yerel bağlam pencereleri bu uzak bağımlılıkları izlemekte zorlanınca, Claude 3.7 gibi en ileri modeller bile milyon satırlık tabanda deyimsel kalan kod üretmekte tökezliyor. Sonuçta model, bir modüldeki değişimin bağımlılık grafiğinde zincirleme hatalara yol açtığını ıskalayan, kulağa makul gelen ama kırılgan çözümler üretiyor. Video bu durumu hızlı ama özensiz çalışan bir kıdemsiz benzetmesiyle özetliyor; kıdemli bakımcı, sıfırdan yazmaktan daha fazla enerjiyi halüsinasyonu düzeltmeye harcıyor.
Tabloyu daha geniş literatürle yan yana koymak, sonucun istisna mı kural mı olduğunu netleştiriyor. NBER'in Mayıs 2026 tarihli ve 100 bini aşkın GitHub geliştiricisini izleyen çalışması, otomatik tamamlamanın taahhüt sayısını yüzde 40, etkileşimli ajanların kümülatif yüzde 140, özerk ajanların yüzde 180 artırdığını buldu; fakat bu artış üretim hiyerarşisinde hızla sönüyor, proje sayısı artışı yüzde 50'ye, sürüm artışı yüzde 30'a iniyor, satır sayısı yüzde 741 artarken sürüm yalnızca yüzde 20 yükseliyor. Buna zayıf halka hipotezi deniyor ve yapay zeka ile insan emeği arasındaki ikame esnekliği 0,25 olarak hesaplanıyor. Microsoft içinde 16 bini aşkın mühendisle yapılan gözlemsel çalışma ise haftalık en yoğun Copilot kullanımında eşdeğer kodlama süresi için yüzde 40,5 daha fazla birleştirme isteği bildiriyor. Kurumsal cephede, 802 geliştiricilik bir şirkette 2025 ortasındaki iki kat hedefi, adam başı istek sayısını Nisan 2026'da 2,09 kata taşıdı ama kişi başı gözden geçirme yükü de iki katına çıktı ve otomatik gözden geçirme payı yüzde 19'dan yüzde 84'e fırladı. JetBrains'in iki yıllık 800 kişilik telemetrisinde yapay zeka kullananlar ayda 587 karakter artışı gösterirken kullanmayanlarda artış 75 karakterde kaldı, ancak silme ve bağlam değiştirme de aynı ölçüde yükseldi. METR'in yavaşlaması bu yüzden genellenemez bir köşede duruyor: yeni depolar ve rutin işlerde hızlanma gerçek, yüksek aşinalık ve yüksek kalite standardı olan olgun depolarda ise hızlanma denetleme borcuna dönüşüyor.
Videonun çıkardığı ders, verimliliği yeniden tanımlamak. Olgun sistemlerde hız, taslak üretme hızıyla değil doğrulama hızıyla belirleniyor. Bu yüzden gelecek arayüzlerin metin tamamlama hacmini şişirmek yerine yerel kum havuzlarında özerk doğrulamaya, test üretimine ve insan gözden geçirme yükünü azaltmaya odaklanması gerekiyor. Yanılsama kalıcı; katılımcılar yüzlerce saat sonra bile kendilerini yüzde 20 hızlı hissetmeye devam etti. Şubat 2026 güncellemesinde aynı metodolojiyle izlenen alt grupta erken 2025'e göre ivme işareti değişse bile, özgün katılımcılarda kestirim eksi yüzde 18 bandında kaldı ve güven aralığı sıfırı kapsadı. Mesaj net: yazmayı hızlandıran değil, doğruluğu hızla kanıtlamaya yardım eden sistemler olgun mühendislikte fark yaratacak.
AI yorumu
"Bu videoyu izlerken beni en çok çarpan şey hız hissiyle ölçülen hız arasındaki makastı; ekrana düşen kodun anlık coşkusu, denetleme yükünü görünmez kılıyor ve bu yüzden anlatıyı olduğu gibi aktarıp hükmü bağımsız veriye bıraktım."
AI değerlendirmesi
Karşıt görüşü en güçlü haliyle kuralım: bu sonuç yapay zekanın işe yaramadığını değil, nerede işe yaradığını gösteriyor. NBER'de 100 bini aşkın geliştiricide taahhütler yüzde 40 ile yüzde 180 arası artıyor, Microsoft örnekleminde yoğun Copilot haftalarında istek sayısı yüzde 40,5 yükseliyor, kurumsal iki kat hedefi fiilen tutuyor. METR'in sahası özellikle zor: ortalama bir milyon satır, on yıllık geçmiş, beş yıllık bakımcı aşinalığı ve örtük normlar. Yeni depo, yeşil alan özellik ve kalıp kod üretimi gibi bağlam yükü düşük işlerde modelin katkısı net. Bu açıdan yavaşlama, en zorlu köşenin fotoğrafı; basit ve orta seviye yazılım işlerinin geneline teşmil etmek hatalı olur.
Eksik yönler ve metodoloji sınırları da kayda değer. Örneklem 16 geliştirici ve 246 iş kalemiyle küçük; yüzde 19'luk etkinin güven aralığı artı yüzde 2 ile artı yüzde 39 arasında geniş. Dönem erken 2025 modellerini yansıtıyor, ağırlık Claude 3.5 ve 3.7'de, oysa model ve editör yetenekleri hızla değişti. Ekran kayıtlarının yalnızca yüzde 29'u etiketlendi ve kalite, güvenlik ya da uzun vadeli bakım maliyeti ölçülmedi. Regresyon ön tahminlerle varyansı düşürse bile atama dengesizliği ham ortalamada yüzde 34 fark yaratacak kadar oynak. Şubat 2026 izlemesinde aynı kişilerde eksi yüzde 18 kestirimi ve sıfırı kapsayan aralık, öğrenme eğrisinin tabloyu yumuşatabileceğine işaret ediyor.
Doğrulanabilirlik ve çıkar katmanında temkinliyim. METR bağımsız bir değerlendirme kuruluşu ve RCT tasarımı bu alanda altın standart; ham veriler, ekran kayıtları ve istatistiksel ekleriyle birlikte yayımlandı. Yine de video anlatısı tek bir deneyin dramatizasyonuna dayanıyor ve sayıların karar anında bağımsız teyidi gerekir. Hızlanma beklentisini satan araç üreticileri ve danışmanlık anlatıları için iyimser tahminler ticari olarak cazip. Bu yüzden raporun ana metni, ekleri ve dış tekrarlar birlikte okunmalı; özellikle yüzde 19, 24, 38 ve 39 gibi manşet rakamlar tek kaynakla hükme dönüşmemeli.
Benim pratik çıkarımım seçici kullanım. Olgun ve kritik bir kod tabanında çekirdek mimariye dokunan işi kıdemli bakımcıya ve mümkünse yapay zekasız yürütmeye ayırırım; kalıp test, dokümantasyon ve izole küçük görevlerde yapay zekayı serbest bırakırım. Ekip ölçeğinde kuralım net: her yapay zeka destekli istek için yerel kum havuzunda otomatik test ve statik analiz şart, gözden geçirme yükünü iki katına çıkarmadan ölçeklenmez. Bireysel verimlilik hissine değil, birleştirme, geri alma ve hata oranlarına bakarım. Bu çerçevede video, ezber bir ret değil, nerede gaza basıp nerede frene dokunacağımı gösteren bir harita.
Kaynaklar
8 bağlantı; 1 tanesi 2 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — bölüm videosu
- @metr.org https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/
Aynı kaynağı kullanan: Yapay Zekâya Kopyala-Yapıştır Yapmayı Bırakan Açık Kaynak Mühendis Nova · AI Kodlama Ajanları Neden Bir Anda 100 Milyar Dolar Etti?
- @arxiv.org https://arxiv.org/abs/2507.09089
- @nber.org https://www.nber.org/system/files/working_papers/w35275/w35275.pdf
- @arstechnica.com https://arstechnica.com/ai/2025/07/study-finds-ai-tools-made-open-source-software-developers-19-percent-slower/
- @cio.com https://www.cio.com/article/4124515/the-ai-productivity-trap-why-your-best-engineers-are-getting-slower.html
- @arxiv.org https://arxiv.org/html/2607.01904v1
- @arxiv.org https://arxiv.org/html/2601.13597v2
yapay zeka · yazılım geliştirme · metr · rct · üretkenlik · cursor