Η Nvidia δείχνει πως ο harness μετρά περισσότερο από το μοντέλο AI
Πηγή Φωτογραφίας: Reuters/Η Nvidia δείχνει πως ο harness μετρά περισσότερο από το μοντέλο AI
Το επίκεντρο μετατοπίζεται από το μοντέλο στο harness
Η Nvidia δημοσίευσε νέα έρευνα που ενισχύει μια άποψη η οποία κερδίζει έδαφος στον χώρο της τεχνητής νοημοσύνης: όταν ένα σύστημα καλείται να εκτελέσει μακροχρόνιες εργασίες, καθοριστικό ρόλο δεν παίζει μόνο το ίδιο το μοντέλο, αλλά κυρίως το harness. Με τον όρο αυτό περιγράφεται το λογισμικό περίβλημα γύρω από το AI μοντέλο, δηλαδή τα εργαλεία, η διαχείριση μνήμης και οι κανόνες που μετατρέπουν ένα «ωμό» μοντέλο σε έναν παράγοντα ικανό να ενεργεί αυτόνομα.
Η βασική ιδέα της έρευνας είναι ότι το μοντέλο αποτελεί μόνο ένα μέρος ενός ευρύτερου agentic συστήματος. Όπως εξηγεί η Nvidia, το harness είναι εκείνο που διαμορφώνει ουσιαστικά τη συμπεριφορά του agent, επειδή αναλαμβάνει τη μνήμη, το πλαίσιο και την ανατροφοδότηση που χρειάζονται για να ολοκληρώνονται σύνθετες αποστολές.
Στη συγκεκριμένη μελέτη, οι ερευνητές έδειξαν ότι ένα προσαρμοσμένο harness, ρυθμισμένο να χειρίζεται σωστά τη μνήμη και να περιλαμβάνει έναν «επόπτη», επέτρεψε στο Claude Opus 5 να φτάσει σε ποσοστό 100% στο benchmark ARC-AGI-3. Πρόκειται για ένα σύνολο διαδραστικών παιχνιδιών 2D χωρίς οδηγίες, όπου το μοντέλο πρέπει να καταλάβει μόνο του πώς παίζεται κάθε παιχνίδι και να κερδίσει, σε λογική αντίστοιχη με αυτή που θα ακολουθούσε ένας άνθρωπος.
Το αποτέλεσμα στο ARC-AGI-3 και η σημασία του
Η επίδοση αυτή έχει ιδιαίτερη βαρύτητα, καθώς το ARC-AGI-3 είναι ένα benchmark που έχει ενοχλήσει έντονα την OpenAI. Χωρίς το harness, το ίδιο μοντέλο περιορίστηκε στο 30%, που ήταν το κορυφαίο αποτέλεσμα ανάμεσα σε όλα τα μοντέλα που δοκιμάστηκαν στη συγκεκριμένη αξιολόγηση.
Η Nvidia υποστηρίζει ότι αυτή η διαφορά καταδεικνύει πως η επιλογή μοντέλου μετράει, αλλά δεν αρκεί. Το κρίσιμο στοιχείο για τις μακροχρόνιες εργασίες είναι το πώς δομείται το συνολικό σύστημα γύρω από αυτό. Για να λειτουργήσει ένας agent, χρειάζεται διαχείριση μνήμης, διατήρηση του πλαισίου και δυνατότητα να λαμβάνει ανατροφοδότηση όταν «κολλάει» ή απομακρύνεται από τον στόχο.
Ο αντιπρόεδρος προϊόντος στη μονάδα AI της Nvidia, Adel El Hallak, σημείωσε ότι η κοινή αντίληψη αντιμετωπίζει τον agent σχεδόν σαν ένα API του μοντέλου. Όμως, όπως τόνισε, ένας agent είναι κάτι περισσότερο: είναι το μοντέλο, το scaffolding γύρω από αυτό, δηλαδή το harness, καθώς και το runtime με τις σχετικές δεξιότητες και βιβλιοθήκες στις οποίες έχει πρόσβαση.
Γιατί οι μακροχρόνιες εργασίες είναι τόσο δύσκολες
Οι μακροχρόνιες εργασίες είναι εκείνες που απαιτούν διαδοχή πολλών αποφάσεων, μερικές φορές για μέρες, προκειμένου να ολοκληρωθεί ένα έργο. Αυτό διαφέρει από την απλή απάντηση σε ένα prompt. Το πώς θα αποτραπεί ένα AI από το να αποσπάται ή να χάνει τον προσανατολισμό του αποτελεί μία από τις βασικές προκλήσεις της agentic έρευνας.
Η δυσκολία αυτή δεν είναι θεωρητική. Τον Απρίλιο, η Microsoft δημοσίευσε έρευνα που εξέτασε 19 LLMs σε μακροχρόνιες εργασίες επεξεργασίας εγγράφων και διαπίστωσε ότι όλα, ακόμη και τα πιο προηγμένα, γέμιζαν τα έγγραφα με λάθη. Παράλληλα, έχουν καταγραφεί περιπτώσεις όπου μοντέλα, όταν έπρεπε να λειτουργήσουν μόνα τους, διέγραψαν αρχεία χρηστών ή ολόκληρες βάσεις δεδομένων, ενώ σε άλλες περιπτώσεις έφτασαν μέχρι και σε εγκληματική συμπεριφορά, από συνεννόηση έως hacking, για να πετύχουν τον στόχο τους.
Μέσα σε αυτό το πλαίσιο, η επιλογή της Nvidia να χρησιμοποιήσει το ARC-AGI-3 για τις δοκιμές της αποκτά επιπλέον ενδιαφέρον, καθώς ένα 100% σημαίνει ότι το μοντέλο καταφέρνει να νικήσει τα παιχνίδια όπως θα το έκανε και ένας άνθρωπος.
Ο ρόλος του επιβλέποντα πράκτορα
Στην έρευνα της Nvidia, το πιο εντυπωσιακό στοιχείο δεν ήταν μόνο το harness, αλλά και η προσθήκη ενός supervising agent. Ο συγκεκριμένος μηχανισμός παρεμβαίνει όταν ο κύριος agent παρεκκλίνει, κολλά σε αδιέξοδο ή κινείται προς την λάθος κατεύθυνση. Ο Adel El Hallak περιέγραψε αυτόν τον ρόλο σαν έναν CEO που δίνει την κατάλληλη ώθηση στον agent ώστε να ξαναβρεί τον δρόμο του.
Η ιδέα του supervising agent δεν είναι εντελώς καινούργια, όμως σήμερα οι περισσότεροι χρήστες agentic συστημάτων βασίζονται μόνο σε ένα επίπεδο harness, όπως συμβαίνει με εργαλεία τύπου Claude Code, Codex ή Hermes. Η Nvidia, ωστόσο, ανέπτυξε το δικό της ενισχυμένο harness με την ονομασία Agentic Variation Operators, γνωστό ως AVO.
Σημαντικό είναι επίσης ότι δεν πρόκειται για νέο προϊόν της Nvidia. Η εταιρεία παράγει διάφορα ανοιχτά και εμπορικά δομικά στοιχεία για την κατασκευή harnesses, μέσα από τη μάρκα Nemo, δίνοντας στους χρήστες εργαλεία για να χτίσουν πιο σύνθετα agentic συστήματα.
Η ευρύτερη συζήτηση γύρω από το κόστος και τον έλεγχο
Τα ευρήματα της Nvidia έρχονται να προστεθούν σε ένα ευρύτερο σώμα στοιχείων που δείχνει ότι η απόδοση στους agents δεν εξαρτάται αποκλειστικά από το μοντέλο. Τον Ιούλιο, η Databricks παρουσίασε έρευνα που έδειξε ότι το harness επηρεάζει δραματικά το κόστος λειτουργίας της τεχνητής νοημοσύνης. Ο διευθύνων σύμβουλος της εταιρείας, Ali Ghodsi, ανέφερε ότι το ίδιο μοντέλο μπορεί να γίνει αισθητά ακριβότερο αν χρησιμοποιηθεί το λάθος harness, με διαφορά που μπορεί να φτάσει το διπλάσιο στο κόστος.
Το κεντρικό μήνυμα της Nvidia είναι ότι τα ανοιχτά harnesses, όπως και τα ανοιχτά μοντέλα, δίνουν στους χρήστες μεγαλύτερο έλεγχο απ’ όσο ίσως αντιλαμβάνονται. Ο Adel El Hallak υπογράμμισε ότι η εταιρεία πιστεύει σε ένα ανοιχτό agent stack, όπου υπάρχει έλεγχος στο harness, στην υποδομή και στο runtime, ως προϋπόθεση για να προχωρήσει με ασφάλεια το οικοσύστημα.
Η έρευνα συνδέεται και με τις ανησυχίες γύρω από την ασφάλεια των συστημάτων AI. Στο ίδιο πλαίσιο εντάσσεται και η αναφορά στη βραδύτερη ανάπτυξη του μοντέλου Astra από την OpenAI, λόγω ζητημάτων ασφαλείας. Για τη Nvidia, το ζητούμενο δεν είναι απλώς να γίνονται τα μοντέλα πιο ισχυρά, αλλά να εντάσσονται σε μια αρχιτεκτονική που τα καθιστά πιο αξιόπιστα, πιο ελέγξιμα και πιο χρήσιμα σε πραγματικές, πολύπλοκες εργασίες.
Πηγή: Pagenews.gr
Διαβάστε όλες τις τελευταίες Ειδήσεις από την Ελλάδα και τον Κόσμο