← Όλα τα άρθρα

Εταιρεία τεχνητής νοημοσύνης για AI agents: οι ερωτήσεις πριν υπογράψετε

Διαλέξτε εταιρεία τεχνητής νοημοσύνης με βάση όσα μπορεί να δείξει πάνω στη δική σας δουλειά, όχι με βάση το demo της. Πριν υπογράψετε, κάντε δέκα ερωτήσεις: ποιο μοντέλο και γιατί, πώς το ελέγχουν, τι σκορ πιάνει στους ελέγχους τους ένας agent που δεν κάνει τίποτα, τι επιτρέπεται να κάνει ο agent χωρίς άνθρωπο, πού πηγαίνουν τα δεδομένα σας, πόσο κοστίζει μία ολοκληρωμένη εργασία, αν αυτό το κόστος μετρήθηκε σε ελληνικά, πώς θα καταλαβαίνουν οι πελάτες ότι μιλούν με AI, τι γίνεται όταν κάτι χαλάσει μέσα στη νύχτα και σε ποιον ανήκει το αποτέλεσμα. Ένας σοβαρός προμηθευτής απαντά σε καθεμία με έναν αριθμό ή ένα έγγραφο. Ένας αδύναμος απαντά με το όνομα ενός framework.

Γιατί είναι πιο δύσκολο να διαλέξετε συνεργάτη για AI απ' ό,τι για μια ιστοσελίδα;

Γιατί το demo δεν αποδεικνύει σχεδόν τίποτα. Μια ιστοσελίδα ή φορτώνει ή δεν φορτώνει, και το βλέπετε. Ένα σύστημα τεχνητής νοημοσύνης που δουλεύει σε μια παρουσίαση μπορεί να αποτυγχάνει αθόρυβα σε πραγματικά δεδομένα, και η αποτυχία φαίνεται εβδομάδες αργότερα, σαν λάθος απάντηση σε πελάτη ή λάθος αριθμός σε μια αναφορά. Η δεύτερη παγίδα είναι τα σκορ που αναφέρουν οι προμηθευτές. Στη δική μου μελέτη κόστους, ένας agent που δεν έκανε τίποτα πήρε 22,8% από τους πραγματικούς βαθμολογητές ενός benchmark, γιατί κάποιοι έλεγχοι επιβράβευαν το να μη γίνει κάτι (what an agent costs). Αν ένας προμηθευτής δεν ξέρει τι σκορ πιάνει η αδράνεια στους δικούς του ελέγχους, το ποσοστό ακρίβειας που σας δίνει δεν έχει πάτο.

Τι ρωτάτε μια εταιρεία τεχνητής νοημοσύνης πριν υπογράψετε;

  1. «Ποιο μοντέλο χρησιμοποιείτε, και τι γίνεται όταν ο πάροχος το αποσύρει;» Οι πάροχοι αποσύρουν μοντέλα με το δικό τους πρόγραμμα, οπότε η σύμβαση χρειάζεται όρο γι' αυτό, όπως εξηγώ στο ποιος πληρώνει όταν κάνει λάθος η τεχνητή νοημοσύνη.
  2. «Πώς είναι το σετ ελέγχου σας, και τι σκορ πιάνει σε αυτό ένας agent που δεν κάνει τίποτα;» Ένα σετ ελέγχου χωρίς σημείο αναφοράς δεν ξεχωρίζει τη βελτίωση από την τύχη. Πώς φτιάχνεται ένα σωστό, στο evals: πώς αποδεικνύετε ότι ένα σύστημα τεχνητής νοημοσύνης δουλεύει.
  3. «Μπορώ να δω αποτελέσματα σε είκοσι δικές μου περιπτώσεις πριν δεσμευτώ;» Είκοσι πραγματικές περιπτώσεις λένε περισσότερα από κάθε case study, και οι αποτυχίες είναι το χρήσιμο κομμάτι. Τι πρέπει να αποδείξει ένα πιλοτικό, στο άρθρο «Από το πιλοτικό στην πραγματική λειτουργία».
  4. «Τι μπορεί να κάνει ο agent μόνος του, και τι θέλει έγκριση από άνθρωπο;» Η απάντηση πρέπει να είναι μια λίστα ενεργειών και όχι μια υπόσχεση, όπως περιγράφω στο human in the loop.
  5. «Πού πηγαίνουν τα δεδομένα μου, και χρησιμοποιούνται για εκπαίδευση;» Ζητήστε τους όρους του παρόχου και σύμβαση επεξεργασίας δεδομένων. Η OpenAI, για παράδειγμα, δηλώνει ότι τα δεδομένα που στέλνονται μέσω του API της δεν χρησιμοποιούνται για εκπαίδευση από προεπιλογή (OpenAI, your data). Η ελληνική πλευρά, στο GDPR και τεχνητή νοημοσύνη.
  6. «Πόσο κοστίζει μία ολοκληρωμένη εργασία, μαζί με τις επαναλήψεις και τον χρόνο ελέγχου;» Μια μηνιαία τιμή χωρίς όγκο και χωρίς ορισμό της εργασίας δεν συγκρίνεται με τίποτα, όπως εξηγώ στο πόσο κοστίζει στην πράξη ένας AI agent.
  7. «Μετρήθηκε αυτό το κόστος σε ελληνικό κείμενο;» Στο σημερινό λεξιλόγιο της OpenAI τα ελληνικά χρειάζονται 2,06 φορές τα tokens των αγγλικών, οπότε μια εκτίμηση πάνω σε αγγλικά είναι περίπου ο μισός πραγματικός λογαριασμός (ελληνικά στην τεχνητή νοημοσύνη).
  8. «Πώς θα ξέρουν οι πελάτες ότι μιλούν με AI;» Το άρθρο 50 του AI Act το απαιτεί, το αργότερο στην πρώτη επαφή (AI Act, άρθρο 50).
  9. «Τι γίνεται όταν ένα API δεν απαντά στις 3 τα ξημερώματα;» Οι επαναλήψεις, οι ειδοποιήσεις και το ασφαλές σταμάτημα είτε είναι σχεδιασμένα είτε λείπουν. Τι χρειάζεται, στο τι κάνει στ' αλήθεια ένας AI agent στις 3 τα ξημερώματα.
  10. «Σε ποιον ανήκουν στο τέλος οι εντολές, ο κώδικας και το σετ ελέγχου;» Το σετ ελέγχου ξεχνιέται πιο συχνά από όλα, και είναι αυτό που επιτρέπει σε μια άλλη ομάδα να αναλάβει.

Ποιες απαντήσεις πρέπει να σας ανησυχήσουν;

  • «Το framework μας το κάνει ακριβές.» Στη μελέτη μου σε έξι agent harness με τέσσερα μοντέλα, η αλλαγή μοντέλου εξήγησε το 88,0% της διασποράς στη συμπεριφορά και ο σχεδιασμός του harness το 6,9% (how much of an agent is the model). Ένα framework είναι τρόπος δουλειάς, όχι απόδειξη. Απόδειξη είναι τα αποτελέσματα στις δικές σας περιπτώσεις.
  • «Έχει ακρίβεια 95%.» Ρωτήστε σε ποιες ερωτήσεις, πότε μετρήθηκε και απέναντι σε ποιο σημείο αναφοράς. Ένα ποσοστό χωρίς σετ ελέγχου είναι σύνθημα.
  • «Ο agent κάνει ό,τι κάνει και ένας άνθρωπος.» Στην ίδια μελέτη, 16 συνεδρίες έσβησαν αρχεία που κανείς δεν τους είχε ζητήσει να αγγίξουν, όλες με ικανά μοντέλα στο cloud. Τα όρια μπαίνουν στον σχεδιασμό, όπως περιγράφω στο άρθρο δικαιώματα AI agents.
  • «Πρώτα κάνουμε fine-tuning σε ένα μοντέλο για εσάς.» Τα περισσότερα έργα χρειάζονται σαφέστερες εντολές και καλύτερη ανάκτηση πολύ πριν χρειαστούν εκπαίδευση, όπως εξηγώ στο RAG, fine-tuning ή καλύτερη εντολή.
  • Καμία ερώτηση προς εσάς. Ένας προμηθευτής που δίνει τιμή πριν ρωτήσει για τον όγκο, τα δεδομένα και το κόστος ενός λάθους κοστολογεί ένα demo, όχι το δικό σας έργο.

Τι πρέπει να λέει η σύμβαση;

Τέσσερα πράγματα σας προστατεύουν. Η παραλαβή μετριέται σε ένα συμφωνημένο σετ ελέγχου από δικές σας περιπτώσεις, με τον στόχο γραμμένο ως αριθμό. Ο προμηθευτής αλλάζει μοντέλο μόνο όσο αυτός ο αριθμός συνεχίζει να πιάνεται. Τα δεδομένα σας καλύπτονται από σύμβαση επεξεργασίας που ονομάζει κάθε πάροχο από τον οποίο περνούν. Και οι εντολές, ο κώδικας και το σετ ελέγχου σας παραδίδονται, ώστε το σύστημα να ζήσει και πέρα από τη συνεργασία. Την πλευρά της ευθύνης, μαζί με το τι γίνεται όταν μια απάντηση είναι λάθος, την εξηγώ στο ποιος πληρώνει όταν κάνει λάθος η τεχνητή νοημοσύνη.

Πώς ξεκινά μια σωστή συνεργασία;

Μικρή και μετρημένη. Κάθε συνεργασία που αναλαμβάνω ξεκινά με μια πρώτη συζήτηση, ένα γραπτό σχέδιο που κοστολογεί τη δουλειά και ένα πιλοτικό στα δεδομένα του πελάτη, πριν υπογραφεί οτιδήποτε μεγαλύτερο. Αυτή η σειρά επιτρέπει και στις δύο πλευρές να δεσμευτούν σε έναν αριθμό: κανείς δεν μπορεί να υποσχεθεί ακρίβεια σε δεδομένα που δεν έχει δει. Τα ίδια τα συστήματα τα περιγράφω στη σελίδα AI agents για επιχειρήσεις, και αρκετά τρέχουν ως demos που λειτουργούν με συνθετικά δεδομένα, που μπορείτε να ανοίξετε πριν από μια πρώτη συζήτηση.

Συχνές ερωτήσεις

Να διαλέξω μεγάλη εταιρεία συμβούλων ή έναν ειδικό;

Διαλέξτε όποιον απαντά στις δέκα ερωτήσεις με αριθμούς για τη δική σας δουλειά. Το μέγεθος φέρνει συνέχεια και διαδικασίες, ο ειδικός συνήθως φέρνει ταχύτητα και απευθείας επαφή με αυτόν που φτιάχνει. Και οι δύο μπορεί να είναι σωστή επιλογή, και οι δύο μπορεί να αποτύχουν στις ερωτήσεις.

Πόσο πρέπει να κρατά ένα πιλοτικό;

Όσο χρειάζεται για να τρέξουν οι είκοσι περιπτώσεις σας, να διαβαστεί κάθε αποτυχία και να διορθωθούν όσες μετράνε. Για μία στενή, καλά ορισμένη εργασία αυτό είναι συνήθως θέμα εβδομάδων και όχι μηνών. Ένα πιλοτικό χωρίς ημερομηνία λήξης και χωρίς αριθμό-στόχο δεν είναι πιλοτικό.

Είναι πάντα πιο ριψοκίνδυνος ένας φθηνότερος προμηθευτής;

Όχι. Ο κίνδυνος βρίσκεται στις ερωτήσεις που μένουν αναπάντητες, όχι στην τιμή. Μια φθηνή πρόταση που δηλώνει μοντέλο, σετ ελέγχου, σημείο αναφοράς και όρια είναι ασφαλέστερη από μια ακριβή που δεν δηλώνει τίποτα από αυτά.

Αν συγκρίνετε τώρα προτάσεις για AI, στείλτε μου τις προτάσεις χωρίς εμπιστευτικά στοιχεία, και θα σας πω ποιες από αυτές τις ερωτήσεις αφήνουν ανοιχτές.