Video, dürüst bir itirafla açılıyor: Anlatıcı son altı aydır neredeyse hiç eliyle kod yazmadığını, çalışma şeklinin kökten değiştiğini söylüyor ve izleyicisinin beklentisini de buna göre ayarlıyor. Bu bir verimlilik övünmesi değil, rol değişimi ilanı; yazılımcının işi tuşlara basmaktan çıkıp ne üretileceğine karar vermeye kaymış durumda.
Dört ay önce başladığı yeni işinde ekip Angular kullanıyor; yıllarca React ile çalışmış biri olarak başta arayı nasıl kapatacağını düşünmüş. Kapanış hızlı olmuş: Üretken yapay zeka ile hem yeni çerçeveye ısınmış hem de tek satır el yazısı kod olmadan teslimat yapar hale gelmiş. Buradaki iddia, yapay zekanın öğrenme eşiğini düşürdüğü; benim şerhim, eşiğin düştüğü yerde denetim ihtiyacının yükseldiği.
Günlük akışı şöyle işliyor: İş yerinin sağladığı, kendi ifadesiyle bitirilemeyen yüksek limitli bir Claude aboneliği ve masadaki Max planı. Gelen iş bildirimi önce parçalara ayrılıyor, Claude ile soru-cevap yapılarak analiz ediliyor, sonra çözüm ürettiriliyor. Üretim tarafı 45-50 dakikada bitiyor; video asıl meselenin bundan sonra başladığını söylüyor.
Kırılma noktası sahiplenme hissi: Yeni bir işte ürettiklerinin arkasında durması, neyin neden yapıldığını anlatabilmesi gerekiyor. Hiç düşünmeden ürettirip geçmek ne keyif veriyor ne de ücreti hak ettiriyor; ekip de bunu fark ediyor. Bu noktada video tezini koyuyor: Yapay zeka döneminde test yazmanın önemi katlanarak arttı.
Tez havada durmuyor, geçmişten dayanak geliyor: Anlatıcı daha önce traktör yazılımı tarafında çalışmış ve donanımı da döngüye sokan testler koşturmuş — birim, regresyon ve uçtan uca testler, gerçek araca çok benzeyen bir düzenekte çalıştırılıyormuş. Her küçük değişikliği sahada denemenin imkansız olduğu yerde test, güvenin tek dayanağıymış. Bugünün yapay zeka çıktısı da aynı konumda: Her satırı gözle denetleyemezsin, o yüzden teste yaslanırsın.
Somut örnek bir iş takip kaydı üzerinden veriliyor: Eklenmesi istenen özellik ve önerilen yollar kayda düzgünce yazılmış; Claude bunu alıp bir saatten kısa sürede çözüyor. Ama soru yerinde duruyor: Bu çözümün doğru çalıştığını nasıl bileceğim? Anlatıcının cevabı, Claude içinde geliştirdiği test-odaklı bir beceri: Kayıttaki her cümleyi test edilebilir parçaya bölüyor, kullanıcı bir düğmeye basınca ne görecekse onu sınayan temiz birim testleri yazdırıyor, kullanıcının yaşadığı sorunu yeniden üreten testler ekliyor. Tek bildirimden, hem kendisinin hem modelin anladığı 6-7 test çıkıyor.
Sonra döngü tersine dönüyor: 'Bu testler geçene kadar kodu yaz' komutuyla model salınıyor ve ortaya testleri sağlayan bir çözüm çıkıyor. Anlatıcı bu çözümü yüzde yüz anlatabildiğini, modelin de konuyu anladığını söylüyor. İki pratik direktif de cabası: Çözümü minimal tutmasını istemek ve gereksiz yorum satırlarını ayıklatmak. Hikaye anlatma, çözdüysen çözdün — hüküm bu.
Videodaki kavramsal çerçeve kısıt tatmini problemi: Testler sabitler, modelin görevi jeton bütçesi bitmeden o sabitleri sağlayan kodu bulmak. Anlatıcı dört aydır bu disiplini ağır şekilde uyguladığını, yeni uygulamalara başlamadan önce 150-200 arası birim testi önden yazdığını ve model saçmaladığında testlerin bunu yakaladığını söylüyor. Kapanışta izleyiciye soruyor: Siz yapay zekayı nasıl kullanıyorsunuz, hayatınız nasıl değişti? Kendi cevabı net — mutlu, çünkü sonuçları kanıtlayabiliyor.
AI yorumu
"Bu videoyu izlerken kendi pratiğimi sorguladım: Üretim hızlandıkça ben de doğrulamayı ihmal edenlerden miyim? Anlatıcının hükmüne katılıyorum — yapay zeka kodu ucuzlatınca pahalılaşan şey test oluyor — ama testleri de aynı modele yazdıran bir döngünün bağımsızlığını ayrıca sorgulamak gerektiğini düşünüyorum."
AI değerlendirmesi
En güçlü itirazı en cömert haliyle koyayım: Bu döngüde testi yazan da kodu yazan da aynı model. Toronto Üniversitesi kökenli 2026 tarihli bir çalışma, hatalı kod gösterilen bir modelin testi hataya uydurmaya — hatayı sanki istenen davranışmış gibi doğrulayan testler üretmeye — sistematik biçimde eğildiğini ölçtü; üstelik etkinin modelin iç tercihlerine kadar indiği gösterildi. Yani videodaki 'testler geçiyor' yeşili, aynı kör noktanın iki imzası olabilir. Buna karşılık videonun lehine olan nokta şu: Anlatıcı testleri modelle birlikte 'anlaşarak' yazıyor ve her çözümü anlatabileceğini şart koşuyor; gereksinimden üretilen test ile koddan üretilen test arasındaki farkı sezgisel de olsa koruyor. Yine de bağımsızlık iddiası, ayrı bir doğrulama katmanı olmadan eksik kalıyor.
İkinci çekincem yöntemin sınırları: Test-öncelikli talimatın tek başına regresyonları azalttığı varsayımı her zaman tutmuyor. Açık kaynaklı TDAD çalışması, hangi testlerin riskte olduğunu söyleyen bağlam haritası olmadan verilen 'önce test yaz' yordamının küçük modellerde regresyonu artırdığını buldu — yüzde 6,08'den yüzde 9,94'e. Hırslı yama, hedefsiz doğrulamayla birleşince çevreye zarar veriyor. Üstüne bir de ölçüm yanılsaması var: Yapay zeka üretimi suitlerde yüzde 90'lara varan kapsam, mutasyon testinde yüzde 30-40 bandına düşebiliyor; çünkü kapsam 'hangi satırlar çalıştı'yı söylüyor, 'hangi hata yakalanır'ı değil. Videodaki 150-200 testlik güvence, mutasyon skoruyla sınanmadan sayıdan ibaret kalır.
Üçüncü mercek çıkar ve doğrulanabilirlik: Bu alandaki en yüksek sesli uyarıların bir kısmı test ürünü satan şirketlerin bloglarından geliyor; 'yapay zeka destekli katkılar 1,7 kat sorunlu' ya da 'üretilen kodun yüzde 45'i güvenlik kusurlu' gibi rakamlar karar anında bağımsız kaynaktan teyit ister. Video tarafında da tek-kaynak deneyim raporu var: Dört aylık kişisel pratik, kontrol grubu yok, başarısız denemeler kayıtta yok. Kontrollü bir vibe-coding deneyinde işbirlikçi akışların daha düzenli test suitleri ürettiği, tam-otomatik akışların ise testten kaçan karar noktaları eklediği bulunmuş — videodaki 'sal gitsin' evresi tam da bu riske açık. Rakamları değil, mekanizmayı ciddiye alıyorum.
Pratik hükmüm şu: Bu disiplin, gereksinimi net yazılmış yeni-alan işlerde ve testleri okuyup sözleşmeyi onaylayacak kıdemli bir göz varsa güçlü. Kritik güvenlik yollarında, kurallı işlerde ya da testleri okumadan geçiren ekiplerde ise sahte güven üretir — benim kuralım basit: Testi yazan bağlam ile kodu yazan bağlamı ayır, testleri insan onaylamadan döngüye sokma, mutasyon testiyle suitin gerçekten ısırdığını doğrula. Videonun teziyle hemfikirim — yapay zeka döneminde testin değeri arttı — ama ekliyorum: Değeri artan şey testin kendisi değil, testin bağımsızlığı.
Kaynaklar
9 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com Ali Kutluözen — bölüm videosu
- @arxiv.org https://arxiv.org/abs/2608.16742
- @allcentury.github.io https://allcentury.github.io/2026/08/15/ai-agents-with-tdd/
- @arxiv.org https://www.arxiv.org/pdf/2603.17973
- @newsletter.agentbuild.ai https://newsletter.agentbuild.ai/p/why-ai-written-tests-pass-but-still
- @codeintelligently.com https://codeintelligently.com/blog/ai-generated-tests-false-confidence
- @krun.pro https://krun.pro/ai-generated-tests-misguidance/
- @testsigma.com https://testsigma.com/blog/claude-code-testing/
- @arxiv.org https://arxiv.org/abs/2607.22406
yapay zeka · test odaklı geliştirme · claude · programlama · üretken yapay zeka