← Όλα τα άρθρα

Jev: πού ταιριάζει ένα decision model σε μια επιχείρηση και πού αποτυγχάνει

Ένα decision model όπως το Jev ταιριάζει σε μια εργασία όταν ισχύουν έξι πράγματα: οι πιθανές απαντήσεις είναι γνωστές από πριν, ένας άνθρωπος θα αποφάσιζε σε λίγα δευτερόλεπτα, η είσοδος είναι κείμενο, ο όγκος είναι μεγάλος, ένα λάθος είναι φθηνό ή πιάνεται, και μέσα στην ερώτηση δεν κρύβονται πράξεις ή σύγκριση ημερομηνιών. Αυτό καλύπτει τη δρομολόγηση αιτημάτων και πελατών, τον έλεγχο των AI agents, το φιλτράρισμα αποτελεσμάτων αναζήτησης, την κατηγοριοποίηση μεγάλων καταλόγων και τη μετατροπή κειμένου σε χαρακτηριστικά για ένα κλασικό μοντέλο. Δεν καλύπτει ό,τι θέλει υπολογισμό, γραφή ή απάντηση που δεν βρίσκεται στο κείμενο. Μέσα σε αυτά τα όρια αποφασίζει με κόστος κλάσματος του σεντ. Έξω από αυτά κάνει λάθος με σιγουριά.

Ποιο είναι το τεστ έξι σημείων;

Πριν από κάθε νέα χρήση, ελέγχω την εργασία απέναντι σε έξι συνθήκες. Αν αποτύχει σε μία, το decision model είναι λάθος εργαλείο, ή το πολύ ένα βήμα δίπλα σε ένα γλωσσικό μοντέλο:

  1. Οι απαντήσεις είναι γνωστές από πριν. Μια σταθερή λίστα επιλογών, μια κλίμακα ή ένα ναι ή όχι.
  2. Είναι γρήγορη κρίση. Κάτι που ένας γνώστης αποφασίζει σε λίγα δευτερόλεπτα με τα σωστά στοιχεία, όχι αλυσίδα συλλογισμών.
  3. Η είσοδος είναι κείμενο, ή ο κώδικας μπορεί πρώτα να τη μετατρέψει σε κείμενο ή σε κατηγορίες με όνομα.
  4. Μετράει ο όγκος ή η ταχύτητα. Πολλές αποφάσεις τη μέρα, ή αποφάσεις που χρειάζονται σε κλάσμα του δευτερολέπτου.
  5. Ένα λάθος είναι φθηνό ή πιάνεται. Οι αβέβαιες περιπτώσεις πηγαίνουν σε άνθρωπο ή σε μεγαλύτερο μοντέλο, ή η απόφαση τροφοδοτεί ένα σύστημα που αντέχει λίγο θόρυβο.
  6. Δεν χρειάζονται πράξεις, μέτρημα ή σύγκριση ημερομηνιών μέσα στην ερώτηση. Η λίστα αδυναμιών της ίδιας της TypeSafe το λέει καθαρά: το Jev δεν είναι αριθμομηχανή και διαβάζει τις ημερομηνίες σαν κείμενο (τεκμηρίωση της TypeSafe).

Σε ποιες δουλειές μιας επιχείρησης ταιριάζει καλύτερα;

  • Δρομολόγηση αιτημάτων, email και πελατών. Σε μια ανεξάρτητη μελέτη με συνθετικά αιτήματα υποστήριξης, η επιλογή της σωστής από τέσσερις ουρές πέτυχε 89,0% (jev-ood-calibration). Ποια ουρά, ποιο τμήμα, πόσο επείγον: αυτή είναι η φυσική πρώτη δουλειά, και ταιριάζει με τη δρομολόγηση που περιγράφω στο chatbot για eshop.
  • Έλεγχος των AI agents και των απαντήσεων της τεχνητής νοημοσύνης. Είναι καταστροφική αυτή η κλήση εργαλείου, κρύβει αυτό το μήνυμα injection, στηρίζει αυτή η πηγή αυτόν τον ισχυρισμό. Σε ένα από τα παραδείγματα της ίδιας της TypeSafe ελέγχθηκαν οκτώ παραπομπές και πιάστηκαν και τα τέσσερα λάθη που είχαν φυτευτεί. Πού μπαίνουν τέτοιοι έλεγχοι σε ένα σύστημα, στο AI guardrails.
  • Φιλτράρισμα αποτελεσμάτων αναζήτησης πριν γραφτεί η απάντηση. Η ερώτηση «απαντά αυτό το απόσπασμα σε αυτή την ερώτηση» για κάθε απόσπασμα που ανακτήθηκε δεν κοστίζει σχεδόν τίποτα: σε ένα νομικό παράδειγμα της TypeSafe, 1.200 κλήσεις βαθμολόγησης κόστισαν 0,0645 δολάρια ΗΠΑ. Άλλους τρόπους να βελτιώσεις την ανάκτηση θα βρεις στο GraphRAG και προηγμένο RAG.
  • Χαρακτηριστικά για ένα κλασικό μοντέλο. Εδώ τα στοιχεία είναι τα πιο ισχυρά. Σε 2.000 κριτικές κρασιών, η πρόβλεψη της βαθμολογίας από τον μέσο όρο έδωσε σφάλμα (RMSE) 3,09, οι μετρήσεις λέξεων 2,47, η απευθείας ερώτηση στο Jev για τη βαθμολογία 2,15, και 38 μικρές ερωτήσεις στο Jev, δοσμένες ως στήλες σε ένα μοντέλο gradient boosting, 1,77. Πολλές στενές πιθανότητες, που τις συνδυάζει ένα μοντέλο εκπαιδευμένο σε πραγματικά αποτελέσματα, νικούν μία απευθείας απάντηση.
  • Κατηγοριοποίηση σε όγκο. Με τους δικούς μου υπολογισμούς, η κατηγοριοποίηση 50.000 προϊόντων ενός e-shop με περίπου 300 tokens το καθένα είναι 15 εκατομμύρια tokens, περίπου 63 σεντς του δολαρίου στο Jev, κι έτσι η επανάληψη σε όλο τον κατάλογο μετά από κάθε αλλαγή γίνεται ασήμαντη υπόθεση.
  • Ταξινόμηση με λίγα παραδείγματα. Σε μια ανεξάρτητη δοκιμή, με ορισμούς κατηγοριών και επισημασμένα παραδείγματα, το Jev έφτασε 92,40% σε ένα γνωστό σετ 77 τραπεζικών κατηγοριών, έναντι 93,66% για το εκπαιδευμένο μοντέλο της αρχικής δημοσίευσης (jev-banking77-experiment). Πώς συγκρίνονται οι ταξινομητές στα δικά σου email, στο αυτόματη ταξινόμηση email με τεχνητή νοημοσύνη.

Ποιες δουλειές μένουν στον κώδικα ή πηγαίνουν σε μεγαλύτερο μοντέλο;

  • Ό,τι έχει πράξεις, μέτρημα ή τιμές. Υπολόγισέ το σε κώδικα και δώσε το αποτέλεσμα ως κατηγορία με όνομα, όπως «εκτός προϋπολογισμού», αντί για σκέτο αριθμό.
  • Λογική με ημερομηνίες. Βγάλε τα μέρη τους και σύγκρινέ τα σε κώδικα.
  • Ερωτήσεις που η απάντησή τους δεν βρίσκεται στο κείμενο. Χωρίς επιλογή «άγνωστο», ένα decision model διαλέγει πάλι απάντηση, συχνά με μεγάλη σιγουριά, όπως εξηγώ στο Jev: όταν η τεχνητή νοημοσύνη επιλέγει αντί να γράφει.
  • Γραφή απαντήσεων, περιλήψεων ή εγγράφων. Ένα decision model δεν γράφει. Συνδύασέ το με γλωσσικό μοντέλο ή με έτοιμα πρότυπα.
  • Προβλέψεις από σκέτους αριθμούς. Τα αριθμητικά δεδομένα είναι η γνωστή του αδυναμία.
  • Εχθρική είσοδος χωρίς άλλες άμυνες. Οδηγίες κρυμμένες στο κείμενο μπορούν να μετακινήσουν τις απαντήσεις του, όπως σε κάθε μοντέλο. Τις άμυνες τις περιγράφω στο prompt injection.

Ποιοι κανόνες το κάνουν ασφαλές σε πραγματική λειτουργία;

  1. Το μοντέλο κρίνει, ο κώδικας ενεργεί. Ο κώδικας υπολογίζει, φιλτράρει και εκτελεί. Το μοντέλο μόνο απαντά σε ερωτήσεις με τύπο.
  2. Κάνε όλες τις ερωτήσεις σε μία κλήση. Στο παράδειγμα της TypeSafe για παράλληλες ερωτήσεις, μία κλήση με 13 ερωτήσεις ήταν περίπου 12 φορές φθηνότερη και 10 φορές ταχύτερη από 13 ξεχωριστές κλήσεις.
  3. Συνδύαζε τις στενές απαντήσεις σε κώδικα, με σταθερά βάρη στην αρχή και με εκπαιδευμένο μοντέλο όταν αποκτήσεις επισημασμένα δεδομένα.
  4. Δρομολόγησε με βάση τη βαθμονομημένη πιθανότητα και το διακύβευμα. Εκτέλεσε, ζήτα επιβεβαίωση ή προώθησε, με όρια ορισμένα ανά ερώτηση πάνω σε δικό σου επισημασμένο δείγμα, όπως εξηγώ στο Jev ή LLM.
  5. Δώσε παντού επιλογή διαφυγής: «άγνωστο», «κανένα από αυτά», «δεν αναφέρεται».
  6. Τρέξε το πρώτα στη σκιά, δίπλα στην τωρινή μέθοδο, σε 1.000 έως 2.000 πραγματικές περιπτώσεις. Οι ανεξάρτητες μελέτες παραπάνω κόστισαν η καθεμία πολύ λιγότερο από ένα δολάριο: η μελέτη βαθμονόμησης περίπου 6 σεντς για 4.621 στοιχεία.
  7. Κατέγραφε την είσοδο, τις ερωτήσεις, τις απαντήσεις, την έκδοση του μοντέλου και το αποτέλεσμα. Αυτό το αρχείο γίνεται το σετ ελέγχου σου, όπως περιγράφω στο evals: πώς αποδεικνύεις ότι ένα σύστημα τεχνητής νοημοσύνης δουλεύει.
  8. Κλείδωσε την έκδοση του μοντέλου μόλις ρυθμίσεις τα όρια. Ένα ψευδώνυμο όπως το «latest» μετακινείται όταν βγαίνει νέα έκδοση, και οι απαντήσεις μπορεί να αλλάξουν χωρίς καμία αλλαγή από τη μεριά σου.

Τι σημαίνουν οι όροι και η υπηρεσία για μια επιχείρηση;

Τρία σημεία μετράνε πριν χτίσεις πάνω του. Οι όροι απαγορεύουν τη χρήση των απαντήσεών του για την εκπαίδευση ή τη «διύλιση» άλλου μοντέλου (TypeSafe Master Customer Agreement, ενότητα 2.3(b)), οπότε δεν μπορείς να χρησιμοποιήσεις το Jev για να επισημάνεις δεδομένα για δικό σου ταξινομητή. Είναι υπηρεσία που τρέχει στους servers του παρόχου, χωρίς έκδοση που να τρέχεις εσύ, και η TypeSafe σταμάτησε τις νέες εγγραφές στις 22 Σεπτεμβρίου 2026 λόγω ζήτησης, οπότε υπολόγισε ότι ο πάροχος μπορεί να αλλάξει όρους, όρια ή διαθεσιμότητα. Και είναι φτιαγμένο πρώτα για αγγλικά: η TypeSafe λέει ότι οι άλλες γλώσσες δουλεύουν με μικρότερη ακρίβεια, οπότε μια ελληνική επιχείρηση το δοκιμάζει πρώτα στα δικά της ελληνικά παραδείγματα. Πώς οι όροι των αδειών καθορίζουν τι επιτρέπεται να φτιάξεις, στο open source LLM: ποιες άδειες επιτρέπουν εμπορική χρήση.

Πότε είναι καλύτερο ένα δικό σου μοντέλο;

Όταν έχεις επισημασμένα δεδομένα και κάνεις τις ίδιες ερωτήσεις χιλιάδες φορές. Μια συνέχεια στο αποθετήριο του benchmark για phishing εκπαίδευσε ένα ανοιχτό μοντέλο 4 δισεκατομμυρίων παραμέτρων σε 1.000 επισημασμένα email, σε 18 λεπτά σε μια κάρτα γραφικών για gaming, και πέτυχε 97,4% σε 500 email που δεν είχε δει, εκεί όπου το Jev, με μία ερώτηση, είχε πετύχει 62,6% στο ίδιο σύνολο δεδομένων (jev-phishing-bench). Μοντέλο εκπαιδευμένο σε επισημασμένα δεδομένα απέναντι σε μοντέλο χωρίς εκπαίδευση δεν είναι δίκαιος αγώνας, δείχνει όμως πόσο αξίζουν τα επισημασμένα δεδομένα. Υπάρχουν και ανοιχτές εναλλακτικές: ένα αντίγραφο με άδεια Apache 2.0, πάνω σε μοντέλο 9 δισεκατομμυρίων παραμέτρων, πέτυχε 90,12% έναντι 93,21% του Jev στο δικό του σετ ελέγχου (Bespoke Nimble).

Συχνές ερωτήσεις

Μπορεί το Jev να τρέξει στον δικό μου server;

Όχι. Το Jev διατίθεται μόνο ως υπηρεσία του παρόχου, απευθείας ή μέσω πυλών όπως το OpenRouter. Αν τα δεδομένα δεν επιτρέπεται να φύγουν από τους servers σου, ο δρόμος είναι ένα ανοιχτό μοντέλο που τρέχεις εσύ, όπως περιγράφω στο τοπικό LLM σε δικό σου server.

Μπορεί ένα decision model να απαντά στους πελάτες μου;

Όχι μόνο του. Μπορεί να αποφασίσει για τι είναι το μήνυμα, πόσο επείγει και αν πρέπει να το δει άνθρωπος. Την ίδια την απάντηση τη γράφουν πρότυπα, ένα γλωσσικό μοντέλο ή ένας άνθρωπος.

Από πού ξεκινάω;

Διάλεξε μία απόφαση που η ομάδα σου παίρνει εκατοντάδες φορές την εβδομάδα, γράψε τις επιλογές, επισήμανε 200 πραγματικά παραδείγματα και τρέξε το μοντέλο στη σκιά, δίπλα στην τωρινή διαδικασία, για δύο εβδομάδες. Οι αριθμοί αυτών των δύο εβδομάδων αποφασίζουν τα υπόλοιπα.

Τέτοιες αποφάσεις βρίσκονται μέσα στους περισσότερους AI agents για επιχειρήσεις που φτιάχνω. Αν έχεις μία στο μυαλό σου, στείλε μου την απόφαση και είκοσι πραγματικά παραδείγματα, και θα σου πω αν περνά το τεστ.

Περισσότερα από το blog

Τι σου μαθαίνουν οι πανελλαδικοί διαγωνισμοί για τις εκρήξεις επισκεψιμότητας

Παίζει το σποτ στην τηλεόραση και η ήσυχη ιστοσελίδα σου παίρνει την επισκεψιμότητα ενός μήνα σε είκοσι λεπτά. Η τεχνολογία καμπανιών για brands όπως ο ΟΠΑΠ και η Coca-Cola μου έμαθε πράγματα που κάθε e-shop πρέπει να κλέψει.

GDPR χωρίς δράματα: συμμόρφωση σχεδιασμένη από την αρχή, όχι μπαλωμένη μετά

Η συμμόρφωση που μπαλώνεται αφού φτάσει το εξώδικο είναι ακριβή και άσχημη. Σχεδιασμένη από την πρώτη μέρα, είναι σχεδόν δωρεάν και κάνει το προϊόν καλύτερο. Η ματιά αυτού που χτίζει, όχι του δικηγόρου.