Blog o bezpieczeństwie FireAI

Autor FireAI Security & Research Team · Opublikowano

Jev i powstanie modeli decyzyjnych: co oznacza sztuczna inteligencja Systemu One dla narzędzi bezpieczeństwa

Jev i powstanie modeli decyzyjnych: co oznacza sztuczna inteligencja Systemu One dla narzędzi bezpieczeństwa

25 września 2026 r. firma TypeSafe AI ogłosiła Jev, pierwszy model w tak zwanej kategorii „System One”: nie chatbot i nie po prostu większy model językowy, ale to, co firma określa jako model decyzyjny - coś, co zostało zbudowane, aby odpowiedzieć na ograniczone pytanie za pomocą wpisanej na maszynie, skalibrowanej odpowiedzi, a nie akapitu prozy. Ogłoszenie jest bogate w konkretne liczby, więc w tym artykule omówiono je dokładnie tak, jak twierdzono, wyraźnie zaznaczono, co mogliśmy, a czego nie mogliśmy zweryfikować, i przyjrzano się, dlaczego leżąca u jego podstaw idea, decydowanie zamiast generować, jest warta poważnego potraktowania, szczególnie w przypadku oprogramowania zabezpieczającego.

Co faktycznie ogłosiło TypeSafe

Założycielem TypeSafe AI jest Diogo Almeida, który w ogłoszeniu pisze, że „w OpenAI pomogłem zbudować metody, dzięki którym modele językowe stały się przydatne w wykonywaniu instrukcji i rozmawianiu z ludźmi”. Jev, nazywany „pierwszym modelem publicznym” firmy, ma zupełnie inne zadanie: wytwarzanie tego, co TypeSafe nazywa bezpiecznymi dla typu wartościami strukturalnymi, ze skalibrowanymi prawdopodobieństwami i wynikami zaufania, generowanymi za pomocą, jak to nazywa, równoległego próbnika, a nie zwykłego dekodowania token po tokenie, i trenowanego za pomocą metody, którą firma nazywa Reinforcement Learning for Calibrated Decisions (RLCD).

  • TypeSafe podaje, że czas reakcji od początku do końca wynosi „70–500 ms” w porównaniu z zmierzonymi wartościami „3 do 329 sekund” dla pionierskich modeli językowych, z którymi porównywał Jev.
  • TypeSafe wycenia tokeny wejściowe na „0,042 USD / MTok”, a tokeny wyjściowe są oznaczone jako bezpłatne.
  • Na podstawie własnych ocen przepływu pracy TypeSafe podaje, że Jev działa „193,6 razy szybciej i 444,6 razy taniej” niż zasady, według których był mierzony.
  • TypeSafe opisuje błąd typu w wynikach Jeva jako „matematycznie niemożliwy”.
  • Jev jest we wczesnym dostępie; TypeSafe twierdzi, że skreśla programistów z listy oczekujących tak szybko, jak to możliwe.

Generacja a decyzja

Duża część tego, co nazywa się „sztuczną inteligencją w produkcji”, po cichu w ogóle nie jest zadaniem pisarskim. Zezwól lub zablokuj połączenie. Eskaluj lub zamknij zgłoszenie. Oznacz lub wyczyść transakcję. Przekieruj wiadomość do tej lub innej kolejki. Pożądanym produktem nie jest proza, jest to etykieta wyciągnięta z krótkiej, ustalonej listy, czasami z dołączoną partyturą. Przeprowadzanie tego rodzaju pytań przez model zbudowany w celu tworzenia płynnych akapitów jest niedopasowaniem: powraca obiekt blob JSON, który należy przeanalizować i mieć nadzieję, że będzie ważny, a jakakolwiek stwierdzona pewność zwykle niewiele znaczy, ponieważ nic nie zmusiło go do śledzenia rzeczywistego poziomu błędów modelu.

Warto tutaj rozdzielić dwa twierdzenia, ponieważ nie są tym samym: wpisane i skalibrowane. Wpisane dane wyjściowe ograniczają kształt odpowiedzi — pytanie „wybór” zwraca jedną z opcji na liście, „wynik” zwraca liczbę z zadeklarowanego zakresu, nigdy przypadkowe zdanie lub wymyślone pole. Kalibracja to pomysł znacznie starszy i zupełnie odrębny. Jest to właściwość statystyczna, a nie stylistyczna: oznacza, że ​​gdy system podaje prawdopodobieństwo na poziomie 0,62, często ma rację w przypadku wielu podobnych przewidywań, więc dalszy program może faktycznie ustawić próg na tej liczbie, zamiast traktować ją jako dekorację.

Własne nazewnictwo TypeSafe zapożycza słownictwo z psychologii, a nie ze statystyk. Daniela Kahnemana, który w 2002 roku otrzymał Nagrodę Nobla w dziedzinie nauk ekonomicznych „za zintegrowanie spostrzeżeń z badań psychologicznych z naukami ekonomicznymi, zwłaszcza dotyczących ludzkich osądów i podejmowania decyzji w warunkach niepewności”, spopularyzował terminy w Myślenie, szybkie i wolne: „System 1” jest „szybki, automatyczny, częsty, emocjonalny, stereotypowy, nieświadomy”, podczas gdy „System 2” jest „powolny, wymagający wysiłku, rzadkie, logiczne, wyrachowane, świadome”. Metafora jest sugestywna, ale opisuje ludzkie poznanie, a nie gwarancję dotyczącą fragmentu oprogramowania. Model może być szybki tak samo, jak System 1, a jego pewność nie ma żadnego znaczenia — na kalibrację trzeba zapracować i zmierzyć, a nie sugerować się nazwą.

Co „nie może mieć halucynacji” może i nie może oznaczać

Twierdzenie TypeSafe, że błąd typu jest „matematycznie niemożliwy”, opisuje ograniczone dekodowanie, technikę, która już istnieje gdzie indziej. Podobną gwarancję zapewnia własny przewodnik po uporządkowanych wynikach OpenAI: ta funkcja, jak mówi, „zapewnia, że ​​model zawsze będzie generował odpowiedzi zgodne z dostarczonym schematem JSON, więc nie musisz się martwić, że model pominie wymagany klucz lub halucynuje nieprawidłową wartość wyliczeniową”. Ta gwarancja jest realna i użyteczna. Jest również węższy, niż się wydaje: ogranicza kształt odpowiedzi, a nie to, czy jest ona prawidłowa. Pytanie „wybierające” z trzema opcjami zawsze zwróci jedną z trzech — w tym, jeśli model błędnie ocenił dane wejściowe, pewną, poprawnie wpisaną, błędną odpowiedź.

Kalibracja to element, który należy sprawdzić, a nie potwierdzić. Standardowym narzędziem jest diagram niezawodności: przewidywania segmentów na podstawie ich ustalonej ufności oraz dla każdego wykresu segmentu, jak często te przewidywania faktycznie okazywały się słuszne; odstęp między przekątną a obserwowaną linią zwykle podsumowuje się jako oczekiwany błąd kalibracji. Nie jest to nowe pytanie w przypadku uczenia maszynowego — Artykuł Guo i wsp. z 2017 r. „O kalibracji nowoczesnych sieci neuronowych” odkrył, że „nowoczesne sieci neuronowe... są źle skalibrowane” domyślnie i że prosta, jednoparametrowa poprawka zwana skalowaniem temperatury była „zaskakująco skuteczna” w naprawie tego problemu. Lekcja dotyczy tego jednego artykułu: kalibracja nie jest właściwością, którą model może o sobie ogłaszać. Jest to coś, co sprawdza się na własnych oznaczonych danych, ponieważ ma tendencję do degradacji dokładnie tam, gdzie jest to najbardziej potrzebne — na wejściach, które w niczym nie przypominają tego, na czym model był dostrojony.

Minimalna uprząż ewaluacyjna (szablon)

Przed przekazaniem prawdziwej decyzji przez jakikolwiek model decyzyjny, Jev czy inny, trzy pytania mają większe znaczenie niż dane dowolnego dostawcy: czy wpisana odpowiedź jest za każdym razem analizowana pod kątem Twojego schematu, czy podana pewność śledzi rzeczywisty współczynnik trafień na oznaczonej próbce własnych danych i czy ta kalibracja przetrwa na danych wejściowych, które różnią się od tego, co model już widział. Poniższy szkic to szablon zbudowany na podstawie kształtu żądania pokazanego w dokumentacji szybkiego startu TypeSafe. Nie zawiera żadnych twierdzeń na temat tego, co pokazałoby zastosowanie go przeciwko Jevowi — nie uruchomiliśmy go i jest to pseudokod ilustracyjny, a nie raport.

kalibracja_check.py — tylko szablon, nie działa przeciwko Jev
# Illustrative pseudo-code. Mirrors the request shape shown in TypeSafe's own
# quickstart docs (POST /v1/systemone with state, model, and typed questions).
# Not run against Jev or any live API; no results are claimed here.
import requests

def ask(state: str, question_id: str, question: dict) -> dict:
    resp = requests.post(
        "https://api.typesafe.ai/v1/systemone",
        headers={"Authorization": f"Bearer {API_KEY}"},
        json={"state": state, "model": "jev-latest", "questions": {question_id: question}},
    )
    return resp.json()["answers"][question_id]

# 1. Shape check: does every response parse against the declared type, on your
#    own edge cases, not just a vendor demo set?
# 2. Calibration check: bucket the stated confidence and compare it to the
#    true label rate, on data the model has never seen.
buckets = {i: {"n": 0, "correct": 0} for i in range(10)}
for state, true_label in labeled_sample:          # your own traffic, labeled by hand
    answer = ask(state, "decision", {"type": "noul", "instructions": "Should this be allowed?"})
    bucket = min(int(answer["noul"] * 10), 9)
    buckets[bucket]["n"] += 1
    buckets[bucket]["correct"] += int(round(answer["noul"]) == true_label)

for b, s in buckets.items():
    if s["n"]:
        stated = (b + 0.5) / 10
        observed = s["correct"] / s["n"]
        print(f"stated~{stated:.2f}  observed={observed:.2f}  n={s['n']}")  # the gap here is your calibration error
  • Niezależnie od tego, czy wpisana odpowiedź zawsze jest analizowana, na danych wejściowych wytwarzanych przez Twój własny system, a nie tylko na zestawie demonstracyjnym dostawcy.
  • Czy podane 0,9 jest prawidłowe w około dziewięciu przypadkach na dziesięć w przypadku Twojego ruchu oznaczonego etykietą, a nie cudzego zestawu ewaluacyjnego.
  • Niezależnie od tego, czy ta kalibracja uwzględnia dane wejściowe inne niż wszystko, co widziała wcześniej: nową aplikację, nowy protokół, nadawcę, który przeczytał to samo ogłoszenie, które właśnie przeczytałeś.
  • Co robi osoba wywołująca w przypadku przekroczenia limitu czasu lub awarii, ponieważ system decyzyjny potrzebuje bezpiecznego ustawienia domyślnego, gdy model decyzyjny jest nieosiągalny.

Dlaczego ma to znaczenie w przypadku narzędzi zabezpieczających

Zapora ogniowa, filtr spamu, kontrola oszustw, kolejka selekcji: każdy z nich to system decyzyjny, który w kółko odpowiada na ten sam kształt pytania — biorąc pod uwagę te dane wejściowe, zezwól na nie lub je zablokuj, z jakim poziomem pewności i gdzie znajduje się próg. Strona ewaluacyjna TypeSafe czerpie przykłady dokładnie z tego obszaru: ocena, czy zamknąć alert bezpieczeństwa, przekazać go do danej osoby, czy natychmiast go zatrzymać, to decyzja dotycząca selekcji, a nie zadanie pisemne, i jest to rodzaj rozmowy, którą narzędzie bezpieczeństwa wykonuje stale, w ilości, której żaden analityk nie jest w stanie sprawdzić ręcznie.

Porównanie ilustracyjne, a nie transkrypcja żadnego rzeczywistego systemu.
Generatywna odpowiedź LLMDecyzja wpisana na maszynie (w stylu Jeva)
WyjścieAkapit wyjaśniający połączenie z nieznanym adresem na nietypowym porcie „może być wart przejrzenia”{zezwól: fałsz, pewność: 0,81 }
Rozbiór gramatyczny zdaniaRegex, czyli drugie wywołanie modelu, mające na celu wyciągnięcie akcji z prozyGwarantowana zgodność z zadeklarowanym schematem
PrógBrak zaufania liczbowego do porównania z politykąWartość zaufania, którą osoba wywołująca może bezpośrednio przekroczyć
Tryb awariiPłynne, wiarygodnie brzmiące, a czasami po prostu błędneŹle z załączoną liczbą, którą kontrola kalibracji może przynajmniej wychwycić średnio

Szczerze mówiąc, kompromis w sprawie prywatności

Jev, jak opisuje to TypeSafe, jest hostowanym interfejsem API: żądanie przenosi „stan”, czyli dowolne dane, których dotyczy pytanie, do serwerów TypeSafe przez Internet. W przypadku przykładów incydentów związanych z bezpieczeństwem i selekcji, które podkreśla sam TypeSafe, ten stan jest dokładnie tym rodzajem informacji, którego wiele osób wolałoby domyślnie nie przekazywać stronom trzecim – która aplikacja komunikuje się z jakim adresem, jak często i z jakiego urządzenia. Wysłanie go do dowolnego modelu chmury, niezależnie od tego, czy jest szybkie czy tanie, oznacza, że ​​dane opuszczają maszynę, z której pochodzą.

FireAI, zapora sieciowa dla systemu MacOS firmy HisnLabs, dokonała odwrotnego wyboru w odniesieniu do kategorii decyzji, o których mowa w tym artykule. FireAI działa na systemie macOS 14 lub nowszym na krzemie Apple za jednorazową opłatą 49 euro i wyraźnie nie jest programem antywirusowym ani siecią VPN. Gdy aplikacja, której wcześniej nie widziałeś, próbuje połączyć się z siecią, FireAI może uruchomić na samym urządzeniu mały model – opcjonalnie 1,5 GB do pobrania – aby sprawdzić połączenie i podać prosty powód; sprawdzany ruch nigdy nie jest nigdzie wysyłany. Każda z tych decyzji wspomaganych przez sztuczną inteligencję staje się widoczną regułą powiązaną z sygnaturą kodu aplikacji, którą można zobaczyć i cofnąć, siedząc obok źródeł zagrożeń, które są stosowane lokalnie, a nie odpytywane na zdalnym serwerze.

Nie twierdzimy, że model FireAI na urządzeniu dorównuje Jevowi lub jakiemukolwiek innemu modelowi systemowemu pod względem surowej poprawności, szybkości lub ceny — nie przeprowadzaliśmy tego porównania i nie mamy własnych ocen do opublikowania tutaj. To ogłoszenie potwierdza kierunek projektowania: aby decyzje dotyczące bezpieczeństwa były dobrze podejmowane przez mały, szybki i ograniczony model działający blisko danych, a nie przez kierowanie ich przez chatbota ogólnego przeznaczenia w innym miejscu. TypeSafe zajmuje się tą sprawą od strony API; FireAI już na nim opiera się od strony urządzenia i z innego powodu — ponieważ w przypadku zapory ogniowej dane, o których mowa, nie powinny w ogóle opuszczać maszyny w celu oceny.

Otwarte pytania

  • Niezależne oceny: żadna strona zewnętrzna nie opublikowała jeszcze reprodukcji mnożników prędkości lub kosztów zawartych w ogłoszeniu TypeSafe, na danych niewybranych przez TypeSafe.
  • Kalibracja w ramach zmiany dystrybucji — dokładny scenariusz, o którym mowa w artykule Guo i innych, i który ma największe znaczenie w przypadku przeciwnika, który dostosowuje się, gdy metoda obrony jest publiczna.
  • Czy cena utrzymuje się przy rzeczywistej wielkości produkcji i czy podane opóźnienie utrzymuje się przy ciągłym obciążeniu, a nie po pojedynczym zademonstrowanym żądaniu.
  • Jak model zachowuje się w przypadku kontradyktoryjnych lub rzeczywiście niejednoznacznych danych wejściowych, gdzie pewna odpowiedź wpisana na maszynie może być mniej szczera niż odpowiedź zawierająca informację „niejasne”.
  • Kiedy zostanie otwarty wcześniejszy dostęp poza listą oczekujących, do kogo i na jakich warunkach dane przesyłane jako „stan”.

Na razie Jev to zestaw twierdzeń zespołu z prawdziwymi referencjami i braku jeszcze zewnętrznej weryfikacji. Kategoria, którą próbuje nazwać – modele decyzyjne, a nie modele generacji – wskazuje na prawdziwą lukę w dotychczasowym dostosowywaniu oprogramowania zabezpieczającego do wykorzystania sztucznej inteligencji. Niezależnie od tego, czy sam Jev wytrzymuje niezależne testy, czy nie, jest to przydatne przypomnienie, że interesującym pytaniem w przypadku zapory ogniowej, filtra oszustw lub kolejki selekcji nigdy nie było „czy może napisać przekonujące zdanie”, ale „czy może podjąć decyzję, za którą będzie mógł się utrzymać, wystarczająco szybko, aby miało to znaczenie”. To pytanie zadajemy w związku z modelem na urządzeniu w FireAI za każdym razem, gdy go zmieniamy — i dlatego dla nas odpowiedź pozostaje na urządzeniu, a nie staje się żądaniem do interfejsu API innej osoby.

Jaką rolę odgrywają FireAI i HisnLabs

We have not tested Jev and make no claim it works as described or that FireAI matches it in any way — but the idea that a security decision deserves a small, bounded, fast model instead of a paragraph from a chatbot is one we built FireAI around a year before TypeSafe wrote a blog post about it.

FireAI to własny produkt HisnLabs: zapora sieciowa z AI działająca bezpośrednio na Macu. Pokazuje prostym językiem każde połączenie nawiązywane przez twoje aplikacje i pozwala ci decydować, co opuszcza twojego Maca — jej AI działa lokalnie, więc twój ruch nigdy nie jest wysyłany do nas ani do nikogo innego. Zespół badań nad bezpieczeństwem HisnLabs dba o to, by te decyzje pozostały trafne: kataloguje, które domeny to zwykła telemetria, a które prawdziwa usługa, śledzi kraj i sieć stojące za połączeniem oraz trenuje lokalny model (funkcję Autopilot) na rzeczywistych wzorcach ruchu — a nic z tego nie opuszcza twojego Maca.

Możesz przeczytać o decyzjach technicznych, które za tym stoją, albo wypróbować FireAI przez 17 dni na FireAI od HisnLabs.

Źródła