Gemeten
Elk cijfer, met zijn datum, zijn machine en zijn bronbestand
Deze pagina bundelt de metingen die de rest van de site aanhaalt. Elke tabel noemt de dag waarop ze is genomen en de machine waarop ze draaide, en een test leest elk getal terug uit het bestand dat het heeft voortgebracht: beweegt dat bestand en de pagina niet, dan wordt de build rood.
Wat hier ontbreekt, is alles wat niemand heeft gemeten. Waar een bron de machine niet vastlegt, zegt de pagina dat in plaats van er een te verzinnen; waar een corpus synthetisch is, reist de zin die dat zegt mee met het getal.
De deterministische laag, op het adversariële corpus
De laag met controlecijfer: identiteitsnummers, IBAN, kaarten, sleutels en tokens. Twee sporen over dezelfde generator — waarden tussen spaties geschreven, en dezelfde waarden geschreven zoals mensen ze schrijven: vastgeplakt aan een los cijfer, met voorvoegsel, in Arabisch-Indische cijfers, met een combinerend teken erin.
Corpus: 1.000 documenten in vier talen, 4.522 gelabelde entiteiten, 443.724 tekens. Machine: Apple M4 Pro, macOS 15.7.4, CPython 3.13.7.
| Spoor | Zaad | Precisie | Terugvinding | Restlek | Oppervlak van deellek | Heen en terug |
|---|---|---|---|---|---|---|
| Coöperatief | 1234 | 1,0000 | 1,0000 | 0,00 % | 0 | 1,000000 |
| Coöperatief | 42 | 1,0000 | 1,0000 | 0,00 % | 0 | 1,000000 |
| Coöperatief | 7 | 1,0000 | 1,0000 | 0,00 % | 0 | 1,000000 |
| Adversarieel | 1234 | 0,9940 | 1,0000 | 0,00 % | 0 | 1,000000 |
| Adversarieel | 42 | 0,9874 | 0,9989 | 0,00 % | 0 | 0,999641 |
| Adversarieel | 7 | 0,9894 | 1,0000 | 0,00 % | 0 | 1,000000 |
Gemeten op 9 augustus 2026 · 1.000 documenten per ronde, drie zaden, beide sporen.
De drie adversariële rijen worden met de rest gepubliceerd: twee ervan liggen onder de drempels die de continue integratie beweert, want daar wordt één zaad getrokken en deze tabel trekt er drie. Wat over alle zes ronden standhoudt, is het paar waarop een datalekgrens wordt beoordeeld: restlek op nul en oppervlak van deellek op nul.
Documenten, in de gateway
Extractie en detectie over het documentcorpus, één verzoek tegelijk. Het zijn cijfers van een enkel verzoek: beide stappen hangen aan de processor en de interpreter zet ze achter elkaar, dus wat de gelijktijdigheid regelt zijn het documentstoplicht en de procesvoorraad, niet deze tabel.
| Document | Extractie | Detectie | Totaal | Gevonden waarden |
|---|---|---|---|---|
| PDF van één pagina met tekstlaag | 1,3 ms | 1,9 ms | 3,2 ms | 6/6 |
| Word-document: tekst en auteurseigenschap | 0,6 ms | 2,1 ms | 2,7 ms | 6/6 |
| Rekenblad: cellen, bladnaam en eigenschappen | 1,4 ms | 1,1 ms | 2,5 ms | 6/6 |
Gemeten op 29 augustus 2026 op fernando · AMD EPYC-Genoa, 16 vCPU, 30 GB.
- Hetzelfde werk in de browser
- 92 ms van begin tot eind voor een PDF van één pagina van 3 MB
Het pad in de browser is een andere uitvoering (pdf.js en pdf-lib) en de testbank zegt dat het niet vergelijkbaar is met de rijen hierboven: daarom staat het op een eigen regel en nooit binnen die tabel.
Deterministisch tegenover NLP
De deterministische laag zoekt geen persoonsnamen; dat is het werk van de NLP-laag. Dit is wat elke stapel achterlaat op hetzelfde corpus: het aandeel gouden PERSON- en LOCATION-waarden dat nog in de uitgaande tekst staat.
Corpus: 400 documenten, 800 gouden entiteiten, zaad 2026.
| Stapel | Restlek | Waarden | Kloktijd |
|---|---|---|---|
| Nul-NER (controle) | 100,000 % | 800/800 | 0,1 s |
| Deterministisch + Presidio | 4,875 % | 39/800 | 3,3 s |
| Deterministisch + Presidio + GLiNER | 0,000 % | 0/800 | 7,1 s |
Gemeten op 12 september 2026 · machine: development laptop.
De nul is geen belofte van nul in productie: het corpus is synthetisch en zijn gouden entiteiten zijn alleen PERSON en LOCATION, het zegt dus niets over echt proza, over adressen of over de bijzondere categorieën. De controlerij op honderd procent maakt de nul leesbaar — zonder haar is een nul niet te onderscheiden van een kapotte schaal.
De drie naamstapels
Wat het meertalige model toevoegt, op het gelabelde corpus van het project zelf. Deze meting is de reden dat het uitgeschakeld wordt geleverd.
Corpus: 300 documenten, 50 per taal, 6 talen.
| Stapel | Per document | Terugvinding | Precisie | Terugvinding in het Catalaans |
|---|---|---|---|---|
| Presidio | 3 ms | 0,990 | 0,905 | 1,000 |
| Presidio + GLiNER | 13 ms | 1,000 | 0,830 | 1,000 |
| + meertalige GLiNER | 72 ms | 1,000 | 0,787 | 1,000 |
Gemeten op 12 september 2026.
Het meertalige model vindt geen naam die de andere twee lagen niet al vinden, ook niet in het Catalaans — Presidio draagt zijn eigen Catalaanse model. Het duurt 5,5 keer zo lang en markeert 39 stukken meer die geen namen zijn: dezelfde tekst van 10.000 tekens gaat van 1.118 ms naar 3.081 ms.
De bron legt de datum en het corpus van deze vergelijking vast, niet de machine. Wat van machine naar machine meegaat, is de verhouding tussen de drie configuraties, niet de milliseconden.
Dat corpus is synthetisch, dus een terugvinding van één is geen bewering over echt schrijven. Het gepubliceerde restlek van de naamlaag is dat uit de tabel hierboven.
Het naamvlak: geheugen en workers
Gemeten op 12 september 2026 binnen het beeld van het vlak op een CCX33 · Falkenstein. Tussen processen wordt niets gedeeld, dus het aantal workers is een deling en geen voorkeur.
- Lege interpreter
- 26 MB
- Geladen modellen
- 3.331 MB, in 13,9 s
- Na een invoer van 10.000 tekens
- 3.412 MB
- Workers
- 6 processen, 20,5 GB. Acht zouden 27,3 GB zijn, boven het plafond van 26 GB dat het compose-bestand zet.
De latentietabel van dit vlak — p95 per tekstgrootte plus de gemeten heen-en-terugtijd — staat op Hoe het werkt en wordt hier niet gekopieerd.
Tegenover wat de aanbieders hebben bewaard
Gemeten op 19 september 2026 met extensie 0.9.0, commit 225bcd18: 4 synthetische bestanden getoetst bij 2 aanbieders. 3 gingen er daadwerkelijk uit; 1 hield de extensie tegen voordat het de browser verliet. Wat elke aanbieder bewaarde is teruggelezen uit zijn eigen kopie van het gesprek, niet van het scherm, dat rehydrateert.
| Bestand | Aanbieder | Bewaarde markeringen | Oordeel |
|---|---|---|---|
| Word-document met een IBAN in de tekst en een ingesloten identiteitsfoto | ChatGPT | 1 | Geen lek |
| PDF met tekstlaag, identiteitsnummer en IBAN | ChatGPT | 2 | Geen lek |
| Gescande PDF, alleen beeld | ChatGPT | nooit verstuurd | Tegengehouden |
| Dezelfde PDF met tekstlaag | Claude | 2 | Geen lek |
Het gescande bestand is nooit verstuurd: geen enkele pagina had een tekstlaag en de extensie brak de verzending af. Ze doet niet alsof ze afdekt wat ze niet kan lezen, dus die regel draagt geen markeringen en geen oordeel over een lek, maar zijn eigen toestand.
Getoetste bestanden: 4 · Verstuurd: 3 · Tegengehouden voor vertrek: 1 · Aanbieders: 2 · Lekken in het verstuurde: 0 · Vastgelegde bevindingen: 7
De markeringen zelf, bestand voor bestand, staan op Hoe het werkt. Geen van de bevindingen van die dag is een lek; het artefact noemt ze stuk voor stuk.
Het pakket dat wordt gepubliceerd
Twee artefacten, niet één. Wat de Chrome Web Store vandaag uitlevert, is het bestand dat een lezer installeert; wat deze repository heeft gebouwd en nog niet heeft geüpload, is een ander bestand. Beide staan hieronder, elk met de dag waarop het gelezen of gebouwd is, samen met de rechten die Chrome de extensie geeft en de sites waarop ze mag draaien.
Wat de store uitlevert — de ondertekende CRX die een lezer installeert:
- Versie die de store uitlevert
- 0.9.0
- Pakket dat de store uitlevert
- 1.098.014 bytes, op 20 september 2026 uit Chromes updatedienst gelezen
Wat deze repository heeft gebouwd — de zip die wordt geüpload, en de controles daarop:
- Hier voorbereid, nog niet geüpload
- Versie 0.9.2 — 1.119.692 bytes, gebouwd op 21 september 2026
- Controles van de motor in de zip
- 63/63, uitgevoerd tegen de ingepakte motor en niet tegen de broncode
- Minimaal Chrome
- 116
De twee verschillen zodra een build op uploaden wacht, en dat gat is gewoon. Wat niet gewoon was, is wat deze pagina tot vandaag deed: ze drukte het voorbereide getal af onder het woord gepubliceerd, en beweerde daarmee een versie en een grootte die de store nooit heeft geleverd.
Rechten (3):
storagescriptingalarms
Sites (4):
https://chatgpt.com/*https://chat.openai.com/*https://claude.ai/*https://licensing.bivelio.com/*
Optionele site, alleen gevraagd als de lezer hem aanzet:
https://gemini.google.com/*
Een zip bewaart wijzigingstijden, dus twee builds van dezelfde bestanden geven verschillende samenvattingen en een samenvatting kenmerkt niets. Van dit artefact worden de bytes gepubliceerd en de dag waarop het is gebouwd; de controle die iets betekent, voert de motor uit die in het pakket zit, niet die uit de repository. De store levert een CRX — dezelfde bestanden plus de handtekeningkop die de store er bij publicatie zelf aan toevoegt — dus zijn grootte is niet die van de zip, en deze pagina vergelijkt de twee getallen niet met elkaar.
Waar deze getallen vandaan komen
Elke tabel hierboven noemt haar bestand. De pagina die stap voor stap doorloopt wat het product ermee doet, is «Hoe het werkt»; de motor kan over je eigen tekst draaien in de speeltuin.