FireAI Güvenlik Blogu

Yazan FireAI Security & Research Team · Yayınlandı

Jev ve Karar Modellerinin Yükselişi: System One Yapay Zekasının Güvenlik Araçları Açısından Anlamı

Jev ve Karar Modellerinin Yükselişi: System One Yapay Zekasının Güvenlik Araçları Açısından Anlamı

25 Eylül 2026'da TypeSafe AI, "Sistem Bir" kategorisindeki ilk model olan Jev'i duyurdu: bir sohbet robotu değil, yalnızca daha büyük bir dil modeli değil, şirketin karar modeli olarak tanımladığı şey - sınırlı bir soruyu düzyazıdan ziyade yazılı, kalibre edilmiş bir yanıtla yanıtlamak için oluşturulmuş bir şey. Duyuru belirli rakamlarla yoğun olduğundan, bu yazı tam olarak iddia edildiği gibi ele alıyor, neyi doğrulayıp neyi doğrulayamadıklarımızı açıkça işaret ediyor ve altta yatan fikrin, yani üretmek yerine karar vermenin, özellikle güvenlik yazılımı için neden ciddiye alınmaya değer olduğuna bakıyor.

TypeSafe gerçekte ne duyurdu?

TypeSafe AI, duyuruda şunu yazan Diogo Almeida tarafından kuruldu: "OpenAI'de, talimatları takip etme ve insanlarla konuşma konusunda dil modellerini faydalı kılan yöntemlerin geliştirilmesine yardımcı oldum." Şirketin "ilk halka açık modeli" olarak adlandırılan Jev, tamamen farklı bir iş olarak sunuluyor: TypeSafe'in kalibre edilmiş olasılıklar ve güven puanları ile tür açısından güvenli yapılandırılmış değerler ürettiği, olağan jeton bazında kod çözme yerine paralel bir örnekleyici olarak adlandırdığı şey aracılığıyla oluşturuldu ve şirketin Kalibre Edilmiş Kararlar için Güçlendirme Öğrenme veya RLCD olarak adlandırdığı bir yöntemle eğitildi.

  • TypeSafe, Jev'i karşılaştırdığı sınır dil modelleri için "3 ila 329 saniye" olarak ölçtüğüne karşılık "70 ms-500 ms" arasında bir uçtan uca yanıt süresi rapor ediyor.
  • TypeSafe, giriş jetonlarını "0,042 $ / MTok" olarak fiyatlandırır ve çıkış jetonları ücretsiz olarak listelenir.
  • TypeSafe, kendi iş akışı değerlendirmelerinde Jev'in, ölçüldüğü politikalara göre "193,6 kat daha hızlı, 444,6 kat daha ucuz" çalıştığını bildiriyor.
  • TypeSafe, Jev'in çıktısındaki bir tür hatasını kendi deyimiyle "matematiksel olarak imkansız" olarak tanımlıyor.
  • Jev erken erişim aşamasındadır; TypeSafe, geliştiricileri "olabildiğince hızlı bir şekilde bekleme listesinden çıkaracağını" söylüyor.

Üretime karşı karar

"Üretimdeki yapay zeka" olarak adlandırılan şeyin büyük bir kısmı kesinlikle bir yazma işi değil. Bir bağlantıya izin verin veya engelleyin. Bir bildirimi üst kademeye iletin veya kapatın. Bir işlemi işaretleyin veya temizleyin. Bir mesajı bir kuyruğa veya diğerine yönlendirin. Arzulanan çıktı düzyazı değil, kısa, sabit bir listeden alınan, bazen de nota eklenmiş bir etikettir. Akıcı paragraflar üretmek için oluşturulmuş bir model üzerinden bu tür bir soruyu çalıştırmak bir uyumsuzluktur: Ayrıştırılması ve geçerliliğinin sağlanması umulması gereken bir JSON bloğu geri gelir ve belirtilen herhangi bir güvenin özellikle pek bir anlamı yoktur çünkü hiçbir şey onu modelin gerçek hata oranını izlemeye zorlamaz.

Burada iki iddiayı ayırmaya değer çünkü bunlar aynı şey değil: yazılan ve kalibre edilmiş. Yazılı bir çıktı cevabın şeklini kısıtlar; bir "seçim" sorusu listedeki seçeneklerden birini döndürür, bir "puan" belirtilen aralıktaki bir sayıyı döndürür; asla başıboş bir cümle veya icat edilmiş bir alan vermez. Kalibrasyon çok daha eski ve tamamen ayrı bir fikirdir. Bu, stilistik değil istatistiksel bir özelliktir: Bu, sistem 0,62'lik bir olasılık belirttiğinde, buna benzer birçok tahminde bunun genellikle doğru olduğu anlamına gelir, dolayısıyla bir alt program, bunu dekorasyon olarak ele almak yerine aslında bu sayıyı eşikleyebilir.

TypeSafe'in kendi adlandırması, kelime dağarcığını istatistikten ziyade psikolojiden almıştır. 2002 yılında "psikolojik araştırmalardan elde edilen içgörüleri, özellikle de belirsizlik altında insan muhakemesi ve karar vermeyle ilgili olarak ekonomi bilimine entegre ettiği için" İktisadi Bilimler alanında Nobel Anma Ödülü'nü alan Daniel Kahneman, Düşünme, Hızlı ve Yavaş'daki terimleri popüler hale getirdi: "Sistem 1", "hızlı, otomatik, sık, duygusal, basmakalıp, bilinçsiz" iken, "Sistem 2", "yavaş, çaba gerektiren, seyrek, mantıksal, hesaplayıcı, bilinçli"dir. Metafor çağrıştırıcıdır ancak bir yazılım parçası hakkında bir garanti değil, insan bilişini tanımlar. Bir model, Sistem 1'in hızlı olduğu gibi hızlı olabilir; beyan ettiği güven hiçbir anlam ifade etmez; kalibrasyonun bir isimle ima edilmemesi, kazanılması ve ölçülmesi gerekir.

"Halüsinasyon göremez" ne anlama gelebilir ve ne anlama gelemez?

TypeSafe'in bir tür hatasının "matematiksel olarak imkansız" olduğu iddiası, başka yerlerde zaten mevcut olan bir teknik olan kısıtlı kod çözmeyi açıklamaktadır. OpenAI'nin kendi Yapılandırılmış Çıktılar kılavuzu da benzer bir garanti veriyor: Bu özellik, "modelin her zaman sizin sağladığınız JSON Şemasına uygun yanıtlar üretmesini sağlar, böylece modelin gerekli bir anahtarı atlaması veya geçersiz bir numaralandırma değeri halüsinasyonu görmesi konusunda endişelenmenize gerek kalmaz." Bu garanti gerçek ve faydalıdır. Aynı zamanda göründüğünden daha dardır: Cevabın doğru olup olmadığını değil, cevabın şeklini kısıtlar. Üç seçenekli bir "seçim" sorusu her zaman üç seçenekten birini döndürecektir; model girdiyi yanlış değerlendirmişse kendinden emin, geçerli bir şekilde yazılmış, yanlış yanıt da buna dahildir.

Kalibrasyon iddia edilmesi değil kontrol edilmesi gereken parçadır. Standart araç bir güvenilirlik şemasıdır: tahminleri belirtilen güvene göre gruplayın ve her grup grafiği için bu tahminlerin gerçekte ne sıklıkla doğru çıktığını gösterir; diyagonal ile gözlemlenen çizgi arasındaki boşluk genellikle beklenen kalibrasyon hatası olarak özetlenir. Bu, makine öğrenimi için yeni bir soru değil — Guo ve arkadaşlarının 2017 tarihli "Modern Sinir Ağlarının Kalibrasyonu Üzerine" makalesi, "modern sinir ağlarının... varsayılan olarak kötü kalibre edildiğini" ve sıcaklık ölçeklendirme adı verilen basit, tek parametreli bir düzeltmenin, bunu onarmada "şaşırtıcı derecede etkili" olduğunu buldu. Ders, bir makalenin ötesinde genelleme yapıyor: kalibrasyon, bir modelin kendisi hakkında duyuracağı bir özellik değildir. Bu, kendi etiketli verileriniz üzerinde kontrol ettiğiniz bir şeydir, çünkü tam olarak en çok ihtiyaç duyduğunuz yerde, yani modelin ayarlandığı şeye hiç benzemeyen girdilerde bozulma eğilimindedir.

Minimal değerlendirme koşum takımı (şablon)

Jev olsun ya da olmasın, gerçek bir kararı herhangi bir karar modeline yönlendirmeden önce, üç soru herhangi bir satıcı rakamından daha önemlidir: Yazılan yanıt her seferinde şemanıza göre ayrıştırılıyor mu, belirtilen bir güven, gerçek isabet oranını kendi verilerinizin etiketli bir örneğinde takip ediyor mu ve bu kalibrasyon, modelin daha önce gördüğünden farklı girdiler üzerinde hayatta kalıyor mu? Aşağıdaki çizim, TypeSafe'in kendi hızlı başlangıç ​​belgelerinde gösterilen istek şekli etrafında oluşturulmuş bir şablondur. Bunu Jev'e karşı çalıştırmanın ne göstereceğine dair hiçbir iddiada bulunmuyor; biz bunu yayınlamadık ve bu açıklayıcı sözde koddur, bir rapor değil.

Calibration_check.py - yalnızca şablon, Jev'e karşı çalıştırılmaz
# Illustrative pseudo-code. Mirrors the request shape shown in TypeSafe's own
# quickstart docs (POST /v1/systemone with state, model, and typed questions).
# Not run against Jev or any live API; no results are claimed here.
import requests

def ask(state: str, question_id: str, question: dict) -> dict:
    resp = requests.post(
        "https://api.typesafe.ai/v1/systemone",
        headers={"Authorization": f"Bearer {API_KEY}"},
        json={"state": state, "model": "jev-latest", "questions": {question_id: question}},
    )
    return resp.json()["answers"][question_id]

# 1. Shape check: does every response parse against the declared type, on your
#    own edge cases, not just a vendor demo set?
# 2. Calibration check: bucket the stated confidence and compare it to the
#    true label rate, on data the model has never seen.
buckets = {i: {"n": 0, "correct": 0} for i in range(10)}
for state, true_label in labeled_sample:          # your own traffic, labeled by hand
    answer = ask(state, "decision", {"type": "noul", "instructions": "Should this be allowed?"})
    bucket = min(int(answer["noul"] * 10), 9)
    buckets[bucket]["n"] += 1
    buckets[bucket]["correct"] += int(round(answer["noul"]) == true_label)

for b, s in buckets.items():
    if s["n"]:
        stated = (b + 0.5) / 10
        observed = s["correct"] / s["n"]
        print(f"stated~{stated:.2f}  observed={observed:.2f}  n={s['n']}")  # the gap here is your calibration error
  • Yazılan yanıtın yalnızca satıcının demo setini değil, kendi sisteminizin ürettiği girdileri de her zaman ayrıştırıp ayrıştırmayacağı.
  • Belirtilen 0,9'un, başka birinin değerlendirme setinde değil, kendi etiketli trafiğinizde onda dokuz kez doğru olup olmadığı.
  • Bu kalibrasyonun daha önce görülmemiş girdiler üzerinde geçerli olup olmadığı: yeni bir uygulama, yeni bir protokol, az önce okuduğunuz duyurunun aynısını okuyan bir gönderen.
  • Karar modeline ulaşılamadığında karar sisteminin güvenli bir varsayılana ihtiyacı olması nedeniyle arayanın zaman aşımı veya kesinti durumunda yaptığı şey.

Bu, güvenlik araçları için neden önemlidir?

Bir güvenlik duvarı, bir spam filtresi, bir sahtekarlık kontrolü, bir öncelik sırası: Bunların her biri, aynı türden soruyu tekrar tekrar yanıtlayan bir karar sistemidir; bu girdi göz önüne alındığında, buna izin verin veya engelleyin, ne kadar güvenle ve eşiğin nerede olduğu. TypeSafe'in kendi değerlendirme sayfası örneklerini tam olarak bu bölgeden alıyor: Bir güvenlik uyarısının kapatılmasına, bir kişiye iletilmesine veya hemen kontrol altına alınmasına karar vermek bir yazma görevi değil, bir önceliklendirme kararıdır ve bu, hiçbir analistin elle inceleyemeyeceği bir hacimde, bir güvenlik aracının sürekli olarak yaptığı türden bir çağrıdır.

Açıklayıcı karşılaştırma, herhangi bir gerçek sistemin kopyası değil.
Üretken LLM yanıtıYazılan karar (Jev stili)
ÇıkışAlışılmadık bir bağlantı noktasındaki tanıdık olmayan bir adrese bağlantıyı açıklayan bir paragraf "incelemeye değer olabilir"{ izin ver: yanlış, güven: 0,81 }
AyrıştırmaDüzyazıdan bir eylemi çıkarmak için Regex veya ikinci bir model çağrısıBildirilen şemayla eşleşmesi garanti edilir
EşiklemeBir politikayla karşılaştırılacak sayısal güven yokArayanın doğrudan eşik alabileceği bir güven değeri
Arıza moduAkıcı, akla yatkın ve bazen tamamen yanlışKalibrasyon kontrolünün en azından ortalama olarak yakalayabileceği bir sayının eklenmesi yanlış

Dürüst olmak gerekirse gizlilik takası

TypeSafe'in tanımladığı şekliyle Jev, barındırılan bir API'dir: bir istek, internet üzerinden TypeSafe sunucularına, sorunun ilgili olduğu veri anlamına gelen "durum"u taşır. TypeSafe'in vurguladığı güvenlik olayı ve önceliklendirme örneklerine göre bu durum, pek çok kişinin varsayılan olarak üçüncü bir tarafa vermemeyi tercih edeceği türde bir bilgidir; hangi uygulama, hangi adresle, ne sıklıkta, hangi cihazdan konuşuyor. Bunu herhangi bir bulut modeline göndermek, ne kadar hızlı ya da ucuz olursa olsun, verinin geldiği makineden çıkması anlamına gelir.

HisnLabs'ın kendi macOS güvenlik duvarı olan FireAI, bu makalenin ilgili olduğu karar kategorisi için tam tersi bir seçim yaptı. FireAI, Apple silikon üzerinde macOS 14 veya sonraki sürümlerde tek seferlik 49 € karşılığında çalışır ve açıkça bir antivirüs veya VPN değildir. Daha önce görmediğiniz bir uygulama ağa ulaşmaya çalıştığında, FireAI, bu bağlantıyı incelemek ve size basit bir neden eklenmiş olarak bilgi vermek için cihazın kendisinde küçük bir modeli (isteğe bağlı 1,5 GB indirme) çalıştırabilir; incelenen trafik hiçbir zaman hiçbir yere gönderilmez. Yapay zeka destekli bu kararların her biri, uygulamanın kod imzasına bağlı, görebileceğiniz ve geri alabileceğiniz, uzak bir sunucuya karşı sorgulanmak yerine yerel olarak uygulanan tehdit akışlarının yanında yer alan görünür bir kural haline gelir.

FireAI'nin cihaz üstü modelinin Jev veya başka herhangi bir sistem-bir modeliyle ham doğruluk, hız veya fiyat açısından eşleştiğini iddia etmiyoruz - bu karşılaştırmayı yapmadık ve burada yayınlayacak kendi değerlendirmelerimiz yok. Bu duyurunun desteklediği şey bir tasarım yönüdür: bir güvenlik kararının, verileri başka bir yere genel amaçlı bir sohbet robotu aracılığıyla yönlendirmek yerine, verilere yakın çalışan küçük, hızlı, sınırlı bir model tarafından iyi bir şekilde yerine getirilmesi. TypeSafe bu durumu API tarafından yapıyor; FireAI zaten bunu cihaz üzerinden geliştiriyor ve farklı bir nedenden dolayı: özellikle bir güvenlik duvarı için, söz konusu verilerin değerlendirilmek üzere makineden ayrılması gerekmiyor.

Açık sorular

  • Bağımsız değerlendirmeler: TypeSafe'in seçmediği veriler üzerinden hiçbir dış taraf TypeSafe'in duyurusundaki hız veya maliyet katlarının bir kopyasını henüz yayınlamadı.
  • Dağıtım değişimi altında kalibrasyon - Guo ve diğerlerinin makalesinin tam olarak ilgili olduğu senaryo ve bir savunma yöntemi halka açık hale geldiğinde uyum sağlayan bir düşmana karşı en önemli olan senaryo.
  • Fiyatlandırmanın gerçek üretim hacminde geçerli olup olmadığı ve belirtilen gecikmenin kanıtlanmış tek bir istek yerine sürekli yük altında geçerli olup olmadığı.
  • Kendinden emin bir şekilde yazılan bir yanıtın "belirsiz" diyen bir yanıttan daha az dürüst olabileceği durumlarda, modelin rakip veya gerçekten belirsiz girdiler karşısında nasıl davrandığı.
  • Bekleme listesinin ötesinde erken erişim açıldığında, "durum" olarak gönderilen veriler kimlere ve hangi koşullarla açılır?

Şimdilik Jev, gerçek kimlik bilgilerine sahip ve henüz dışarıdan doğrulanmamış bir ekibin iddialarından ibaret. Adlandırmaya çalıştığı kategori, yani üretim modellerinden ziyade karar modelleri, şimdiye kadar yapay zekayı kullanacak güvenlik yazılımlarının nasıl oluşturulduğu konusunda gerçek bir boşluğa işaret ediyor. Jev'in kendisi bağımsız testlere dayansa da dayanmasa da, bir güvenlik duvarı, sahtekarlık filtresi veya öncelik sırası için ilginç sorunun asla "ikna edici bir cümle yazabilir mi" değil, "gerisinde durabileceği bir kararı önemli olacak kadar hızlı bir şekilde verebilir mi?" olduğunu hatırlatmak yararlı olacaktır. FireAI içindeki cihaz içi model hakkında, onu her değiştirdiğimizde sorduğumuz soru budur - ve bizim için yanıtın başka birinin API'sine istek olmaktan ziyade cihazda kalmasının nedeni de budur.

FireAI ve HisnLabs burada nereye oturuyor

We have not tested Jev and make no claim it works as described or that FireAI matches it in any way — but the idea that a security decision deserves a small, bounded, fast model instead of a paragraph from a chatbot is one we built FireAI around a year before TypeSafe wrote a blog post about it.

FireAI, HisnLabs’in kendi ürünüdür: doğrudan Mac’inizde çalışan, yapay zekâ destekli bir güvenlik duvarı. Uygulamalarınızın kurduğu her bağlantıyı sade bir dille gösterir ve Mac’inizden neyin çıkacağına sizin karar vermenizi sağlar — yapay zekâsı yerel olarak çalışır, yani trafiğiniz asla bize ya da başka birine gönderilmez. HisnLabs güvenlik araştırma ekibi bu kararların isabetli kalmasını sağlayan ekiptir: hangi alan adlarının sıradan telemetri, hangilerinin gerçek bir hizmet olduğunu kataloglar, bir bağlantının ardındaki ülkeyi ve ağı izler ve cihaz üzerindeki modeli (Autopilot özelliği) gerçek trafik örüntüleriyle eğitir — üstelik bunların hiçbiri Mac’inizden dışarı çıkmadan.

Arkasındaki teknik kararları okuyabilir ya da FireAI’yi 17 gün boyunca deneyebilirsiniz: HisnLabs’ten FireAI.

Kaynaklar