Veri Hazırlığı (data readiness) Projenin Kaderini Modelden Önce Belirler

Tıkanan yapay zeka projelerinin çoğu modelde tıkanmaz. Planın var saydığı verinin başka bir sistemde, daha kötü bir formatta ve veriyi paylaşmayı hiç kabul etmemiş bir sahibin elinde olduğu anlaşıldığı için tıkanır. NVIDIA'nın 2026 tarihli bir anketi, katılımcıların yüzde 48'inin yapay zeka benimsemesinin önündeki engel olarak veriyle ilgili sorunları gösterdiğini bildirdi; bu oran, yapay zeka uzmanlığı eksikliğinin ve getiri belirsizliğinin önünde yer aldı. Bizim sahada gördüğümüz tablo da bununla uyumlu: ilk belge veya tahminleme projesinde teknik risk neredeyse hiçbir zaman model seçimi değil, elinizdeki veri kümesinin gerçek durumudur. Doğru yanıt daha uzun bir keşif aşaması değil, iki haftada çalıştırabileceğiniz ve yönetim toplantısında savunabileceğiniz puanlı bir değerlendirmedir.

Bu yazı, bizsiz de çalıştırabilesiniz diye baştan sona yazılmış değerlendirmenin kendisidir. Dokuz boyut var; her biri, görüş değil gözlemlenebilir koşullar tarif eden bir ölçüte göre sıfırdan üçe puanlanıyor ve toplam 27 puan ediyor. Her boyutun mühendislik eforu cinsinden bir iyileştirme bandı var; böylece düşük puan belirsiz bir endişeye değil, doğrudan haftalara dönüşüyor. Çıktı bir sayı, bir dilim tanımı ve sahibi belli bir iyileştirme planıdır. Bunu kapsam dokümanını yazmadan önce çalıştırın, çünkü hayali veriye göre yazılmış bir kapsam birinci haftada değil altıncı haftada çöker; bu bağlantıyı yapay zeka projesinde kapsam belirleme yazımızda ayrıntılandırıyoruz.

Ölçütten önce iki uyarı. Hazırlık puanı kurumunuz hakkında bir yargı değildir: değerlendirdiğimiz kurumların neredeyse tamamı en az iki boyutta kötü puan alır ve ilk değerlendirmelerin ortancası orta banda düşer. Puan, projeyi yönlendirmek için vardır, müşteriye not vermek için değil. İkincisi, hiç kimse soruları hafızadan yanıtlamasın. Her puanın arkasında birinin gerçekten çektiği bir kanıt olmalı: bir kayıt sayısı, bir dosya örneklemi, bir yetki ekranının görüntüsü, hukuktan gelen yazılı bir yanıt. Bir veri sahibinin kendi deposu hakkında inandığı şey ile rastgele bir örneklemin gösterdiği şey arasındaki fark, bu işin en pahalı sürprizidir.

Karne: Dokuz Boyut, Sıfırdan Üçe, Toplam 27 Puan

Dokuz boyut şunlar: bulunabilirlik ve envanter, erişim ve yetkiler, format ve makine okunabilirliği, hacim ve uzun kuyruk (long tail) kapsaması, etiketleme durumu ve etiket uyumu, tazelik ve güncelleme sıklığı, köken (lineage) ve sahiplik, kalite kusurları, hukuki ve rıza duruşu. Her boyut sıfırdan üçe puanlanır, yani aralık sıfır ile 27 arasındadır. Sıfır, koşulun hiç bulunmadığı ve kimsenin tarif edemediği durumdur. Bir, gayriresmi olarak var olduğu ama hiç ölçülmediği durumdur. İki, belgelenmiş, ölçülmüş ve ilk canlı iş akışı için yeterli olduğu durumdur. Üç ise mühendisliği yapılmış durumdur: otomatik, izlenen ve kuran kişiden bağımsız olarak tekrarlanabilir.

Toplamı dört bantta okuyun. 22 ile 27 arası yeşildir: hemen inşa edin ve veri işinin toplam proje eforunun kabaca yüzde 15'inin altında kalmasını bekleyin. 16 ile 21 arası sarıdır: devam edin, ancak model çalışmasından önce tipik olarak üç ila altı haftalık bir iyileştirme sprinti ekleyin ve bunu kendi kabul kriterleri olan ayrı bir faz olarak plana yazın. 10 ile 15 arası kırmızıya yakındır: bu, sonunda yapay zeka çıktısı bulunan bir veri mühendisliği işidir ve pilotun bir anlam ifade etmesi için genellikle iki ila dört ay gerekir; aksini varsaymak aynı işi daha yüksek maliyetle ileriye ötelemekten başka bir şey yapmaz. Onun altında hiç başlamayın.

Üç boyut, iyi bir toplamı tek başına veto edebilir. Hukuki ve rıza duruşunda alınan sıfır, toplam ne olursa olsun projeyi durdurur; hiçbir temiz metin, hukuka aykırı bir işlemeyi hukuka uygun hale getirmez. Erişimde alınan sıfır, ekibin verinin bir kopyasını hiç edinemeyeceği anlamına gelir ve diğer bütün puanları tahmine çevirir. İhtiyaç duyduğunuz ölçekte makine okunabilirliğinde alınan sıfır ise ilk teslimatın bir yapay zeka sistemi değil bir OCR programı olduğunu söyler. Puanlamayı, kanıtlar önceden toplanmış halde tek bir iki saatlik oturumda yapın, anlaşmazlığı aşağı doğru çözün ve her puanın yanına tek satır kanıt yazın. Belge yoğun işlerde erişim, makine okunabilirliği ve hukuki duruşun ağırlığını ikiye katlayıp 36 puanlık bir ölçek kullanıyoruz.

Birinci, İkinci ve Üçüncü Boyut: Bulabiliyor, Alabiliyor ve Okuyabiliyor musunuz

Bulunabilirlik ve envanter, iş akışının dokunacağı her deposu adıyla, adediyle ve adı geçen bir insan sahibiyle sayabiliyor musunuz sorusudur. Sıfır: kimse sistemleri listeleyemez ve sözleşmeler nerede sorusunun yanıtı ortak sürücüde bir yerde olur. Bir: iki üç sistem adlandırılır, adet ve sahip bilgisi yoktur, keşif meslektaşlara sorarak yapılır. İki: her sistem adıyla, büyüklük mertebesi düzeyinde adediyle ve adı geçen bir sahiple listelenir. Üç: kesin adetler, saklama konumu, sahip, saklama süresi kuralı ve yenileme sıklığı içeren yazılı bir envanter vardır. Böyle bir envanteri sıfırdan çıkarmak beş ila on depo için tipik olarak üç ila sekiz mühendis-günü, kendi kimlik doğrulaması olan her ek sistem için bir ila iki gün daha alır.

Erişim ve yetkiler, erişimin teoride mümkün olup olmadığını değil, proje ekibinin verinin bir kopyasını fiilen elinde tutup tutamayacağını sorar. Sıfır: hiçbir yol yoktur, toplu dışa aktarım için emsal yoktur ve her talep ayda bir toplanan bir komiteye gider. Bir: ilke olarak mümkündür, dosya dosya ve altı ila on haftalık onay süreciyle. İki: tanımlı bir dilimin toplu dışa aktarımı iki ila üç hafta içinde onaylanır ve salt okunur bir servis hesabı açılabilir. Üç: kapsamı sınırlı bir servis hesabı zaten vardır veya beş iş gününden kısa sürede açılabilir, belgelenmiş bir API ya da döküm prosedürü mevcuttur. Onaydan sonraki entegrasyon işi küçüktür, tipik olarak iki ila beş mühendis-günü; onaylar ise efor değil takvim süresidir ve biz bunun için üç ila sekiz hafta ayırırız.

Makine okunabilirliği en sık tatsız bir sıfır üreten boyuttur. Sıfır: yalnızca taranmış görüntüler, önemli bir kısmı 200 dpi altında, metin katmanı yok, kritik alanlarda el yazısı var. Bir: yüzde 40 ila 60 arası doğal metin ve Türkçe karakterleri bozan eski bir motordan gelmiş OCR katmanı. İki: yüzde 80'in üzerinde doğal metin, çoğunlukla kurtarılabilir tablolar, tutarlı karakter kodlaması. Üç: neredeyse tamamen doğal metin veya belgelenmiş şeması olan yapılandırılmış kayıtlar. 100 bin ila 500 bin sayfalık bir OCR hattı, kalite örneklemesi dahil tipik olarak üç ila altı hafta sürer; kağıdı yeniden taramak ise aylarla ölçülen fiziksel bir operasyondur. Bunu tartışmayın, ölçün: rastgele 200 sayfa çekin, kullanacağınız OCR'ı çalıştırın ve karakter hata oranını hem genel hem de Türkçeye özgü karakterler için ayrı raporlayın. Latin metnini yüzde 98 doğrulukla okuyan bir sistem, isimde anlam taşıyan harflerde hâlâ başarısız olabilir; bizim ölçümlerimizde 300 dpi ile 200 dpi arasındaki fark, hangi arama stratejisinin uygulanabilir olduğunu değiştirir.

Dördüncü, Beşinci ve Altıncı Boyut: Kapsama, Etiketler ve Tazelik

Hacim ve uzun kuyruk kapsaması, riski taşıyan nadir vakaların veri kümesinde hiç temsil edilip edilmediğini sorar. Sıfır: yalnızca yakın tarihli ve yaygın örnekler vardır, nadir sınıfların sıfır ila beş örneği bulunur. Bir: baş kısım iyi kapsanmıştır ama istisnalar açısından kritik sınıfların her birinde 30'dan az örnek vardır. İki: ilk iş akışının ele alması gereken her sınıfta en az 50, en nadir sınıfta en az 20 örnek vardır. Üç: sınıf başına 200 ve üzeri örnek vardır ve bunlar en yeni dilim olarak değil, zaman, bölge ve iş birimi boyunca bilinçli örneklemeyle toplanmıştır. Uzun kuyruk örneklerini toplamak çoğunlukla mühendislik değil iş tarafı eforudur; tipik olarak bir alan uzmanının arşivden vaka çekip doğrulamasıyla iki ila altı hafta sürer.

Etiketleme durumu ve etiket uyumu, çoğu değerlendirmede doğru olanın ne olduğunun hiç yazılmadığının fark edildiği boyuttur. Sıfır: hiçbir yerde referans doğru yoktur. Bir: etiketler bir iş sürecinin yan ürünü olarak vardır, tanımlar belgelenmemiştir, uyum hiç ölçülmemiştir. İki: yazılı bir etiketleme kılavuzu, 200 ila 500 etiketli kayıt ve iki etiketleyicinin beş kayıttan yaklaşık dördünde aynı yanıtı verdiği çift etiketli bir örneklem vardır. Üç: kılavuza ek olarak bir hakemlik süreci ve kimsenin üzerinde eğitim yapmadığı, dondurulmuş 300 ila 1.000 kayıtlık bir değerlendirme kümesi vardır. Çift etiketlemeyle 300 ila 500 kayıtlık altın küme kurmak tipik olarak sekiz ila on beş kişi-günü alan uzmanı zamanı ve iki ila dört mühendis-günü araç geliştirme maliyeti çıkarır. Uyuşmazlığı özensizlik değil, görev hakkında bilgi olarak okuyun: kendi kıdemli uzmanlarınız kayıtların yüzde 30'unda anlaşamıyorsa hiçbir model bu tavanın üzerinde ölçülemez.

Tazelik ve güncelleme sıklığı, elinizdeki anlık görüntünün ne kadar bayat olduğunu ve bir sonrakinin nasıl geleceğini sorar. Sıfır: yaşı bilinmeyen bir anlık görüntü ve yenisini almanın hiçbir yolu yoktur. Bir: yıllık veya ihtiyaç halinde alınan bir döküm vardır, sonuncusu altı aydan eskidir ve yenileme manuel talep açarak yapılır. İki: değişen kayıtların ayırt edilebildiği, belgelenmiş aylık bir yenileme vardır. Üç: değişiklik yakalama, güvenilir değişiklik zaman damgaları veya olay günlüğü ile çalışan, gecikmesi 24 saatin altında artımlı bir besleme vardır. Tek bir kaynak için manuel dökümü zamanlanmış artımlı bir veri hattına çevirmek tipik olarak iki ila dört hafta sürer; kaynakta güvenilir bir değişiklik zaman damgası yoksa ve değişikliği bulmak için tüm anlık görüntüleri karşılaştırmanız gerekiyorsa bu süre belirgin biçimde uzar.

Yedinci, Sekizinci ve Dokuzuncu Boyut: Köken, Kusurlar ve Hukuki Duruş

Köken ve sahiplik, sistemin ürettiği herhangi bir yanıtın kaynak kayda kadar izlenip izlenemeyeceğini sorar. Sıfır: bir satırdan veya belgeden kayıt sistemine giden hiçbir yol ve adı geçen hiçbir sahip yoktur. Bir: durum gayriresmi olarak bilinir ve sahip bir kişi değil bir ekiptir. İki: her veri kümesinin adı geçen bir sahibi, belgelenmiş bir kaynağı ve kullanılabilir birleştirme anahtarları vardır. Üç: uçtan uca kalıcı tanımlayıcılar vardır, böylece kullanıcıya bir yanıtın arkasındaki tam kayıt gösterilebilir. Kalıcı tanımlayıcıları ve bir köken alanını sonradan eklemek kaynak başına tipik olarak bir ila üç hafta alır. Sponsora bunu açıkça söyleyin: köken olmadan atıf üretemezsiniz ve atıf olmadan düzenlemeye tabi hiçbir iş akışında onay alamazsınız.

Kalite kusurları; kopyaları, çelişkileri, hâlâ dolaşımda olan yürürlükten kalkmış belgeleri ve karakter kodlaması bozulmalarını kapsar. Sıfır: hiçbiri sayısallaştırılmamıştır, eski sürümler serbestçe dolaşır ve Türkçe metinde bozuk karakterler gözle görülür. Bir: sorunlar bilinir ama ölçülmemiştir, yüzde 10 ila 30 arası yakın kopya olduğundan şüphelenilir. İki: ölçülmüştür, kopya oranı yüzde 10'un altındadır, hangi sürümün geçerli olduğuna dair yazılı bir kural vardır ve kodlama UTF-8'e normalleştirilmiştir. Üç: ölçülür ve izlenir, her belgenin halefini bildiği bir yürürlük modeli ve örneklem üzerinde çelişki kontrolleri vardır. 100 bin ila 500 bin belgede kopya ayıklama tipik olarak iki ila dört hafta sürer ve bunun büyük kısmı kod değil iş tarafı doğrulamasıdır. Aritmetiği yapın: yüzde 22 yakın kopya oranına sahip 200 bin belgede 44 bin kayıt gereksizdir ve bunlar insanların en çok önemsediği belgelerin etrafında kümelenir; ilk on sonuçta aynı genelgenin dört kopyası çıkar ve gerçek kapsama altı sıradan üçe düşer.

Hukuki ve rıza duruşu veto boyutudur. Sıfır: hukuki sebep bilinmiyor, özel nitelikli kişisel veri var ama işaretlenmemiş ya da tedarikçi sözleşmesi içeriğin üçüncü tarafça işlenmesini yasaklıyor. Bir: hukuki sebep tartışmalı, belgelenmiş bir değerlendirme yok ve işlemenin kendi altyapınız dışında çalışıp çalışamayacağı net değil. İki: hukuki sebep 6698 sayılı Kanun'un 5 ve 6'ncı maddeleri kapsamında belgelenmiş, işlemenin nerede çalışabileceğine dair karar kayda geçmiş ve sözleşmeler gözden geçirilmiş. Üç: bunlara ek olarak tasarlanmış bir veri azaltma veya maskeleme adımı, onaylanmış bir işleme konumu ve 10'uncu maddedeki aydınlatma yükümlülüğü ile 12'nci maddedeki güvenlik yükümlülüğü için yazılı yanıtlar var. Doğal başvuru kaynağı KVKK'nın üretken yapay zeka rehberidir; bunu KVKK üretken yapay zeka rehberi okumamızda ele alıyoruz.

Toplamı Karara Çevirmek

Sık gördüğümüz biçimde bir örnek hesap. Bir kurum şu puanları alıyor: bulunabilirlik 2, erişim 1, makine okunabilirliği 1, kapsama 2, etiketleme 0, tazelik 2, köken 1, kusurlar 1, hukuki duruş 2. Toplam 27 üzerinden 12 ediyor ve kırmızıya yakın banda düşüyor. Etiketlemedeki sıfır resmi bir veto değil ama belirleyici, çünkü sistemin çalışıp çalışmadığını ölçmenin hiçbir yolu yok. Öneri hayır değil. Öneri; teslimatları bir erişim yolu, 400 kayıtlık bir altın küme, bir OCR referans ölçümü ve kopyalardan ayıklanmış bir dilim olan on ila on dört haftalık bir ilk faz. Model çalışması ise ancak bu faz kendi kabul testini geçtikten sonra başlıyor.

Karneyi çalıştırmaya değer kılan şey tam olarak bu yeniden çerçeveleme, çünkü veri maliyetini gizli bir bütçe aşımından açık bir bütçe kalemine dönüştürüyor. Yürüttüğümüz projelerde veri hazırlığı ilk faz eforunun yaklaşık yüzde 15 ila 40'ı arasında bir yer tutuyor ve bu aralığın hangi ucunda olduğunuzu imza atmadan önce size söyleyen tek şey bu değerlendirme oluyor. 27 üzerinden 12 gösteren ve maliyeti çıkarılmış bir iyileştirme fazı içeren bir teklifi onaylatmak, iyimser bir takvim gösterip üçüncü ayda ek bütçe isteyen bir teklife göre çok daha kolaydır. Maliyet yapısını yapay zeka projesi maliyeti yazımızda daha ayrıntılı açıyoruz.

Zafer ilan etmek yerine iyileştirmeden sonra yeniden puanlayın. Gözlemlenebilir seviyeleri olan bir ölçütün asıl faydası, ikinci turun ucuz olmasıdır: kanıt toplama işi zaten betiklenmiştir ve oturum yine iki saat sürer. İyi yürütülen bir iyileştirme sprintinin tipik olarak üç boyutu birer seviye yukarı taşıdığını görüyoruz; bu, kırmızıya yakın banttan sarı banda geçmeye yeter ama tek seferde yeşile ulaşmaya nadiren yeter. Canlıya geçiş kararından önce de yeniden puanlayın, çünkü pilot mühendisin dizüstünden çıkıp başkasının sağlaması gereken bir altyapıya taşındığında erişim ve tazelik düzenli olarak geriler; bu geçişi pilottan canlıya geçiş yazımızda ele alıyoruz.

Yeterli Olan Bir Dilimdir (slice), Bir Külliyat Değil

Temiz veriye neredeyse hiçbir zaman ihtiyacınız yok. İlk iş akışı için yeterince temiz, tanımlı bir dilime ve o dilimin ne olduğunu yazıya dökme disiplinine ihtiyacınız var. Dilimi aynı anda dört eksende kesin: tek belge türü, tek departman veya iş birimi, tek tarih aralığı, tek dil. Bu şekilde tanımlanan bir dilim test edilebilirdir, çünkü tek bir alan uzmanı içindeki bütün sınır vakalara bakabilir; ayrıca müzakere edilebilirdir, çünkü kapsam dışında ne kaldığını parmakla gösterebilirsiniz. Arşivdeki her şey olarak tanımlanan bir külliyat ise ikisi de değildir. On sekiz ay süren ve hiç yayına çıkmayan pilotların en yaygın nedeni, hiç kesilmemiş bir kapsamdır.

İki veri kümesini karşılaştırın. Yüzde 80'i temiz olan 5.000 belge size 4.000 kullanılabilir kayıt verir ve daha önemlisi, hangi 1.000 kaydın bozuk olduğunu gösterebilirsiniz. Yüzde 40'ı temiz olan 500.000 belge ise ilke olarak 200.000 kullanılabilir kayıt verir ama hangileri olduğunu söyleyemezsiniz; bu da her arama sonucunu yazı tura, her değerlendirme sayısını yerini tespit edemediğiniz gürültü üzerinden alınmış bir ortalama haline getirir. Yerini tespit edemediğiniz temizlik, temizlik değildir. Küçük küme değerlendirmeyi de karşılanabilir kılar: tek türden 5.000 belgeden çekilen 300 kayıtlık örneklem temsil eder, kırk türe yayılmış 500.000 belgeden çekilen 300 kayıtlık örneklem hiçbir şeyi temsil etmez.

Dilimi dar kesin ama zorluğu dışarıda bırakmayın. İnsanın içinden temiz, yeni ve düzgün biçimlenmiş belgeleri seçmek gelir; bu da hiçbir şey kanıtlamayan ve gerçek dağılımla temas ettiği anda çöken bir pilot üretir. Kullandığımız kural şudur: dilim, kendi kapsamının uzun kuyruğunu içermek zorundadır. Departman dokuz belge alt türü işliyorsa, biri yalnızca on bir kez görünse bile dokuzu da dilime girer; onun yerine komşu departmanı çıkarın. Genişleme kuralını dilimle aynı anda yazın: mevcut dilim iki ardışık yenileme döngüsünde değerlendirme sayılarını koruyorsa ve tek seferde tek eksende genişletiyorsanız, bir şey bozulduğunda hangi eksenin bozduğunu bilirsiniz. Çalışan bir RAG sistemine ikinci belge türü eklemek yeni değerlendirme kümesiyle birlikte tipik olarak bir ila üç haftadır; ikinci dil eklemek daha pahalıdır, çünkü hem arama kalitesi hem de parçalama davranışı değişir. Bunu Türkçe hukuk verisiyle RAG yazımızda tartışıyoruz.

Bu Değerlendirmenin Altıncı Hafta Yerine Sıfırıncı Haftada Yakaladığı Hatalar

300 bin taranmış görüntüden ibaret olan dijital arşiv. Birileri arşivin 2015'te dijitalleştirildiğini söyler ve bu doğrudur; değerlendirme ise dijitalleştirmenin metin katmanı olmayan, 200 dpi siyah-beyaz taramalar anlamına geldiğini ve dosyaların tarama partisi adlarıyla klasörlendiğini ortaya çıkarır. Sıfırıncı haftada bulunduğunda bu, bilinen bir doğruluk tavanı olan üç ila altı haftalık bir OCR programı ve hangi alanların kurtarılabileceğine dair dürüst bir konuşmadır. Altıncı haftada bulunduğunda ise demo sözü verilmiş bir takvim, birinin e-postayla gönderdiği 500 dosyalık temiz bir örneklem üzerine arama katmanını kurmuş bir ekip ve gecikme kelimesini ilk kez duyan bir sponsordur.

Hukuk dışa aktarımı onaylamaz. Geç geldiğinde bu ölümcüldür, çünkü takvimi değil mimariyi geçersiz kılar. Altı haftasını dış işleme varsayımı üzerine inşa ederek geçirmiş bir ekip, tedarikçi sözleşmesinin içeriğin üçüncü tarafa gönderilmesini yasakladığını veya veri kümesinin kimsenin işaretlemediği özel nitelikli kayıtlar taşıdığını keşfeder. Aynı soru sıfırıncı haftada sorulduğunda bir tasarım kısıtı üretir: işleme sizin kontrol ettiğiniz altyapıda kalır, model seçimi buna göre daralır ve maliyet tahmini bunu en baştan yansıtır. Soruyu spesifik sorun. Bu serbest mi diye değil; onayı kim imzalar, karar için ne görmesi gerekir ve bu kurumda benzer onaylar geçmişte ne kadar sürmüştür diye sorun.

Sonra sessiz olanlar geliyor. Etiket olmayan etiket: kategori alanını belgeyi dosyalayan kişi doldurur, model altta yatan ayrımı değil dosyalama alışkanlığını öğrenir ve pilot, kabaca üçte biri yanlış olan etiketlere karşı yüksek doğruluk raporlar. Tek sanılan kaynağın aslında üç olması: iki departman farklı zamanlarda göç etmiştir, kayıtlar örtüşür, ortak anahtar yoktur ve 180 bin belge sayısı gerçekte 140 bin belge ile meta verileri ayrışmış 40 bin kısmi kopyadır. Tazelik tuzağı: pilot ilk hafta çekilen bir anlık görüntü üzerinde çalışır ve yenilemenin sahibi yoktur. Bir de kodlama bozulması: eski bir dışa aktarım Türkçe karakterleri bozar, tam eşleşme filtreleri etkilenen kayıtları sessizce atlar ve demo sorguları İngilizce yazıldığı için kimse fark etmez. Dördü de şema incelemesinde görünmez, rastgele 300 kayıtlık bir örneklemde apaçıktır.

Değerlendirmeyi Yürütmek: Oda, Takvim ve Çıktılar

Odada altı rol bulunmalı ve bunların beşi mühendis değil. Her veri deposu için, içinde gerçekte ne olduğunu söyleyebilecek bir veri sahibi. Altyapı tarafından, kimlik bilgisi talep edebilen değil fiilen açabilen bir kişi. Doğru olanın ne olduğunu tanımlama yetkisi bulunan bir alan uzmanı. Hukuki sebep sorularını yukarı eskale etmek yerine yanıtlayabilen, hukuk veya kişisel verilerden sorumlu bir kişi. İşi fiilen yapacak ve bu yüzden yanıtlara inanmak zorunda olan bir mühendis. Ve sponsor: sonunda otuz dakika için, puanı ve öneriyi iki hafta sonra bir özet slaytından değil doğrudan duymak üzere odada olmalı.

Tek iş akışlı bir kapsam için tipik takvim süresi iki ila üç hafta, gerçek efor ise beş ila on mühendis-günüdür. Aradaki fark beklemedir: bir kimlik bilgisi, bir hukuk yanıtı, biten bir dışa aktarım işi için. Altıdan fazla kaynak sistem varsa veya hukuki inceleme sıfırdan başlıyorsa dört ila altı hafta daha dürüst bir aralıktır. Kullandığımız sıra şudur: envanteri çıkarmak için yarım günlük açılış, bir hafta örnekleme ve ölçüm, iki saatlik puanlama oturumu ve bir sunum. Seçilmiş örneklemi asla kabul etmeyin: tanımlayıcı mod alma veya tarih aralığı gibi mekanik tanımlanmış rastgele bir çekim isteyin ve erişiminiz varsa kendiniz çekin. Yardımsever bir meslektaşın seçtiği örneklem popülasyondan sistematik olarak daha temizdir, çünkü açıklaması kolay belgeler seçilir.

Devam ya da durdur kararı için kopya oranını veya OCR hata oranını yeterli hassasiyetle kestirmek üzere 300 kayıt yeterlidir; popülasyon heterojense ve sınıf bazında tahmine ihtiyacınız varsa 1.000 kayıt zahmete değer. Beş çıktı üretilir ve hepsi kısadır. Depo başına bir satır olacak şekilde adet, sahip, erişim yolu ve yenileme sıklığı içeren bir envanter tablosu. Her boyut için tek satır kanıt içeren bir karne. Tek paragraflık bir dilim tanımı. Her kalemi için efor bandı ve adı geçen bir sahip içeren bir iyileştirme planı. Ve ölçülmüş bir referans: OCR karakter hata oranı, kopya oranı ve etiket uyumu. Bu referans, yapay zeka yatırım getirisi (ROI) ölçümü yazımızda anlattığımız hesabın başlangıç noktasıdır.

Bunu HatsonTech'te Nasıl Yürütüyoruz

Bu değerlendirmeyi belge yoğun her iş için teklif vermeden önce yürütüyoruz ve satış öncesi bir jest olarak değil, ücretli iş olarak yürütüyoruz; çünkü gerçek mühendislik günü harcıyor ve müşterinin bizimle devam edip etmemesinden bağımsız olarak sahibi olduğu bir doküman üretiyor. Teslimat yukarıdaki beş çıktıdır. İlk istediğimiz şey, kontrol edebileceğimiz bir kuralla tanımlanmış 300 ila 1.000 kayıtlık rastgele bir çekim; ikincisi altyapı tarafında adı geçen bir kişi. İlk hafta içinde ikisi de sağlanamıyorsa bu zaten bir bulgudur ve bunu birinin bizim için seçtiği bir örneklemle etrafından dolaşmak yerine sunumda açıkça söylüyoruz.

Her zaman aldığımız iki ölçüm var. Birincisi, 200 sayfalık rastgele bir örneklemde OCR karakter hata oranı ve bunun Türkçeye özgü karakterler için ayrıca raporlanması; çünkü bu sayı, tam eşleşme filtrelemenin ve hibrit aramanın uygulanabilir olup olmadığına, yoksa her şeyin embedding tarafına yaslanması gerekip gerekmediğine karar veriyor. İkincisi, yakın kopya oranı ve hangi sürümün hangisini yürürlükten kaldırdığına dair, bizim varsaymadığımız, iş tarafının doğruladığı yazılı bir kural. İki alışkanlık da kendi ürünlerimizden geliyor: caseon.ai ve DiligenceAI, yürürlükten kalkmış bir sürümün kendinden emin biçimde döndürülmesinin cevapsızlıktan daha kötü olduğu belge kümeleri üzerinde çalışıyor.

Müşterilerin beklediğinden daha sık hayır diyoruz. 27 üzerinden kabaca 12'nin altında bir model işine başlamıyor, bunun yerine kendi kapsamı ve kendi kabul kriterleri olan bir veri mühendisliği fazı öneriyoruz. Bu, kendi başına bir ihtiyat değil: kimsenin yenileyemediği veya izini süremediği bir veri kümesi üzerine kurulan model bir çeyrek içinde sürdürülemez hale gelir ve onu geri sökmenin maliyeti, veri hattı işini önce yapmanın maliyetini aşar. Puanınız bu banda düşüyorsa faydalı sonraki adım bir model denemesi değil, veri mühendisliği çalışmamızdır; envanter, erişim yolu, OCR referans ölçümü ve yenileme takvimi bu fazda gerçekten kuruluyor.