02. ΜΕΤΡΗΣΗ ΣΥΣΤΗΜΑΤΩΝ AI
Τι κοστίζει ένας agent ανά εκτέλεση, τι κάνει έναν agent να δουλεύει και γιατί η ίδια χρονιά βγάζει και 5% και 88% υιοθέτηση AI. Μετρημένα πάνω σε συστήματα που τρέχουν, μαζί με τις εκδόσεις που χειροτέρεψαν.
03
Το κενό της υιοθέτησης
Είκοσι πολυαναφερόμενα στατιστικά για το AI, βαθμολογημένα σε έξι κριτήρια. Γιατί η ίδια χρονιά δίνει 5% και 88%, πού βρίσκονται πραγματικά οι ελληνικές επιχειρήσεις όταν ξεχωρίσεις τις κατηγορίες μεγέθους και γιατί η εξήγηση περί έλλειψης δεξιοτήτων δεν αντέχει μπροστά στα στοιχεία δαπανών.
31 σελίδες,
61 ισχυρισμοί,
10 αρχεία δεδομένων
Διάβασέ το
PDF 0,9 MB
Δεδομένα
04
Τι κάνει πραγματικά ένα agent harness να δουλεύει
Τρία agent harnesses πάνω σε ένα μοντέλο, 45 βαθμολογημένες συνεδρίες. Περιλαμβάνει τρία σφάλματα που βρέθηκαν στο ίδιο το όργανο μέτρησης και δύο δημοσιευμένα ευρήματα που αποσύρθηκαν εξαιτίας τους.
31 σελίδες,
48 ισχυρισμοί,
43 αρχεία δεδομένων
Διάβασέ το
PDF 0,6 MB
Δεδομένα
05
Τι κοστίζει πραγματικά ένας agent
Επτά εκδόσεις ενός agent σε πραγματική λειτουργία πάνω στο ίδιο benchmark, μαζί με τις δύο που χειροτέρεψαν, και ένας αρνητικός μάρτυρας που δείχνει ότι το σετ δοκιμών δίνει 22,8% ακόμα και σε κάτι που δεν κάνει απολύτως τίποτα.
27 σελίδες,
39 ισχυρισμοί,
27 αρχεία δεδομένων
Διάβασέ το
PDF 0,5 MB
Δεδομένα
08
Πόσο από έναν agent είναι το μοντέλο
Έξι agent harnesses, τέσσερα μοντέλα, έντεκα σενάρια και ένας μάρτυρας που δεν κάνει τίποτα. Το μοντέλο εξηγεί το 88 τοις εκατό της διαφοράς και το harness το 7, ενώ δεκαέξι συνεδρίες κατέστρεψαν αρχεία χρηστών από μια ασαφή εντολή.
24 σελίδες,
49 ισχυρισμοί,
122 αρχεία δεδομένων
Διάβασέ το
PDF 0,4 MB
Δεδομένα
09
Τι παίρνουν οι crawlers της AI και τι επιστρέφουν
Δύο ελληνικοί ιστότοποι, 58 ημέρες παρατήρησης ο καθένας, μετρημένοι από τα δικά τους access logs. Από εξακόσιες έως δύο χιλιάδες τριακόσιες σελίδες για κάθε επισκέπτη που στέλνουν πίσω, σε ιστότοπους που δεν απέκλεισαν ποτέ κανέναν crawler.
20 σελίδες,
29 ισχυρισμοί,
28 αρχεία δεδομένων
Διάβασέ το
PDF 0,4 MB
Δεδομένα
12
Το κέλυφος, όχι το σύστημα
Το ίδιο μοντέλο σε Linux και Windows. Εβδομήντα έξι εντολές της μορφής που γράφει ένα μοντέλο από προεπιλογή περνούν σε ποσοστό 97,4 τοις εκατό σε κέλυφος POSIX και 26,3 τοις εκατό στο PowerShell που παίρνει στην πράξη ο πράκτορας, στο ίδιο μηχάνημα. Η διαφορά του λειτουργικού δεν είναι καν ανιχνεύσιμη, και οι έξι εντολές που όντως αλλάζει αναφέρουν όλες επιτυχία.
19 σελίδες,
82 ισχυρισμοί,
37 αρχεία δεδομένων
Διάβασέ το
PDF 0,4 MB
Δεδομένα