Voice AI: Η νέα αγορά των 20 δισ. που διεκδικούν OpenAI, Google και ElevenLabs

Πάνω από 20 δισ. δολάρια επενδύονται φέτος στην τεχνολογία Voice AI, πυροδοτώντας νέα κούρσα μεταξύ τεχνολογικών κολοσσών και ανερχόμενων startups

Voice AI © Pixabay

Η επόμενη μεγάλη μάχη της τεχνητής νοημοσύνης δεν δίνεται πλέον μόνο στην οθόνη και στο πληκτρολόγιο. Δίνεται στη φωνή. Από την εξυπηρέτηση πελατών και τη ζωντανή μετάφραση έως τους ψηφιακούς βοηθούς που ακούν, απαντούν και εκτελούν εντολές σε πραγματικό χρόνο, η λεγόμενη τεχνολογία Voice AI εξελίσσεται σε ένα από τα μεγαλύτερα επενδυτικά στοιχήματα της τεχνολογικής βιομηχανίας.

Οι τεχνολογικοί κολοσσοί και οι δυναμικές startups δίνουν τη μάχη για την κυριαρχία σε μια αγορά που αναπτύσσεται με εκρηκτικούς ρυθμούς.

Σύμφωνα με στοιχεία της PitchBook, τα οποία επικαλείται η Handelsblatt, μέχρι τις αρχές Αυγούστου του 2026 οι επενδυτές επιχειρηματικών κεφαλαίων είχαν τοποθετήσει 20,4 δισ. δολάρια σε εταιρείες που δραστηριοποιούνται στην τεχνητή νοημοσύνη φωνής, χωρίς να περιλαμβάνονται οι επενδύσεις στην OpenAI. Πρόκειται για θεαματική αύξηση σε σχέση με τα προηγούμενα χρόνια, καθώς σε ολόκληρο το 2025 οι αντίστοιχες επενδύσεις είχαν φτάσει τα 8,6 δισ. δολάρια, έναντι 7,6 δισ. το 2024. Μόνο στο πρώτο τρίμηνο του 2026 επενδύθηκαν περίπου 7 δισ. δολάρια, έναντι μόλις 1 δισ. δολαρίων την αντίστοιχη περίοδο του προηγούμενου έτους.

Η λογική πίσω από αυτή την έκρηξη είναι απλή: για τον άνθρωπο είναι πιο φυσικό και γρήγορο να μιλά παρά να πληκτρολογεί. Το μεγάλο ερώτημα είναι αν η φωνή μπορεί πράγματι να εξελιχθεί στο «νέο πληκτρολόγιο» και να γίνει η βασική διεπαφή με τα συστήματα τεχνητής νοημοσύνης.

Από τα τηλεφωνικά κέντρα σε μια αγορά 84 δισ. δολαρίων

Η Voice AI περιλαμβάνει συστήματα που μπορούν να αναγνωρίζουν, να παράγουν, να μεταφράζουν και να αναπαράγουν προφορικό λόγο. Σήμερα η εξυπηρέτηση πελατών παραμένει το σημαντικότερο πεδίο εφαρμογής, κυρίως επειδή προσφέρει μεγάλο όγκο συναλλαγών, μετρήσιμα αποτελέσματα και άμεση δυνατότητα μείωσης του κόστους.

Ωστόσο, οι εφαρμογές επεκτείνονται γρήγορα σε τομείς όπως η διαχείριση ανθρώπινου δυναμικού, η πληροφορική, οι τηλεδιασκέψεις, η παραγωγή περιεχομένου και οι εταιρικές διαδικασίες.

Η Gartner εκτιμά ότι η ευρύτερη αγορά του Conversational AI, στην οποία περιλαμβάνονται τόσο οι φωνητικές όσο και οι βασισμένες σε κείμενο εφαρμογές που μπορούν να πραγματοποιούν ολοκληρωμένους διαλόγους, θα αυξηθεί από 6,9 δισ. δολάρια το 2022 σε 84 δισ. δολάρια το 2032.

Η OpenAI θεωρεί τη φωνή στρατηγικό μέσο για να κάνει τα μοντέλα της περισσότερο προσβάσιμα. Ο επικεφαλής στρατηγικής της εταιρείας, Jason Kwon, δήλωσε στη Handelsblatt ότι στόχος είναι η δημιουργία ενός ακόμη τρόπου αλληλεπίδρασης με τα μοντέλα, ώστε αυτά να γίνουν χρήσιμα σε πολύ μεγαλύτερο αριθμό ανθρώπων.

Ακόμη και η νέα συσκευή πάνω στην οποία εργάζεται η OpenAI μαζί με τον πρώην επικεφαλής σχεδιασμού της Apple, Jony Ive, θεωρείται πιθανό να βασίζεται σε σημαντικό βαθμό στη φωνητική αλληλεπίδραση.

Οι επενδύσεις στην τεχνολογία Voice AI

ΈτοςΕπενδύσεις σε δισ. δολάριαΑριθμός συμφωνιών
20182,1423
20192,1448
20202,9463
20216,5614
20224,8606
20234,3580
20247,6632
20258,6765
2026, έως 7 Αυγούστου20,4348

Παγκόσμια στοιχεία, χωρίς να περιλαμβάνονται οι επενδύσεις στην OpenAI. Πηγή: PitchBook / Handelsblatt. 

Ένα ακόμη ενδιαφέρον στοιχείο είναι ότι, ενώ το συνολικό ύψος των επενδύσεων εκτοξεύεται, ο αριθμός των συμφωνιών είναι αισθητά χαμηλότερος. Αυτό δείχνει ότι τα κεφάλαια συγκεντρώνονται πλέον σε λιγότερες εταιρείες, τις οποίες οι επενδυτές θεωρούν ικανές να διεκδικήσουν σημαντικό κομμάτι της αναδυόμενης αγοράς.

ElevenLabs: Ο ευρωπαϊκός παίκτης των 22 δισ. δολαρίων

Μεγάλος κερδισμένος από αυτή την τάση είναι η ElevenLabs. Η πολωνοβρετανική startup, που ιδρύθηκε το 2022 από τους Mati Staniszewski και Piotr Dabkowski, έχει αναπτύξει μοντέλα που δημιουργούν συνθετικές φωνές, διαβάζουν κείμενα, μεταγράφουν προφορικό λόγο και χρησιμοποιούνται για μετάφραση και συγχρονισμό περιεχομένου.

Σε πρόσφατη συναλλαγή στη δευτερογενή αγορά, κατά την οποία εργαζόμενοι και πρώιμοι επενδυτές μπορούσαν να πουλήσουν μετοχές, η ElevenLabs αποτιμήθηκε στα 22 δισ. δολάρια, γεγονός που, σύμφωνα με τη Handelsblatt, την καθιστά την πολυτιμότερη startup τεχνητής νοημοσύνης της Ευρώπης.

Η ανάπτυξη είναι αντίστοιχα εντυπωσιακή. Μέχρι τα τέλη Ιουνίου, ο ετήσιος επαναλαμβανόμενος τζίρος της αυξήθηκε μέσα στη χρονιά από 330 εκατ. σε 600 εκατ. δολάρια, με την εταιρεία να αποδίδει μεγάλο μέρος της αύξησης στους εταιρικούς πελάτες.

Στο πελατολόγιό της βρίσκονται μεταξύ άλλων η Deutsche Telekom και ο όμιλος Burda, ενώ η Telekom έχει επενδύσει στην εταιρεία μέσω του επενδυτικού της βραχίονα T.Capital.

Η ElevenLabs επιχειρεί πλέον να εξελιχθεί από εταιρεία συνθετικής φωνής σε ολοκληρωμένη πλατφόρμα φωνητικής AI για επιχειρήσεις, οργανισμούς και κυβερνήσεις. Η Ελλάδα αποτελεί χαρακτηριστικό παράδειγμα, καθώς τον περασμένο Μάιο η πολωνοβρετανική startup υπέγραψε μνημόνιο συνεργασίας με την ελληνική κυβέρνηση για την ανάπτυξη φωνητικών υπηρεσιών στο Gov.gr.

Η συνεργασία επεκτείνεται στον τουρισμό, μέσω του VisitGreece και εφαρμογών για μουσεία και αρχαιολογικούς χώρους, αλλά και στη διατήρηση των ελληνικών διαλέκτων, με τη δημιουργία ψηφιακής βιβλιοθήκης τοπικών φωνών και τη δυνατότητα ανάπτυξης AI agents που θα μιλούν, για παράδειγμα, κρητικά.

Η ελληνική περίπτωση αποτυπώνει τη μεγαλύτερη φιλοδοξία της ElevenLabs: να μετατρέψει τη φωνή από εργαλείο παραγωγής περιεχομένου σε βασική διεπαφή επικοινωνίας με την τεχνητή νοημοσύνη.

Voice AI: OpenAI και Google ανεβάζουν ταχύτητα

Η μάχη, όμως, δεν περιορίζεται στις startups. Τα στοιχεία χρήσης των μεγαλύτερων τεχνολογικών εταιρειών δείχνουν ότι η φωνή αποκτά ήδη μαζικό κοινό.

Σύμφωνα με στοιχεία που παραθέτει η Handelsblatt, περισσότεροι από 150 εκατομμύρια άνθρωποι την εβδομάδα χρησιμοποιούν τις λειτουργίες ομιλίας και υπαγόρευσης του ChatGPT. Η Google, από την πλευρά της, αναφέρει ότι από τον Απρίλιο έχει διπλασιαστεί ο αριθμός των χρηστών της λειτουργίας φωνητικής αναζήτησης, ενώ οι συνομιλίες με φωνητικούς βοηθούς μπορούν να διαρκούν έως και πέντε φορές περισσότερο από τις αντίστοιχες αλληλεπιδράσεις μέσω κειμένου.

Η OpenAI επενδύει παράλληλα σε νέα μοντέλα που μπορούν να ακούν και να μιλούν σχεδόν ταυτόχρονα. Όπως εξηγεί ο προγραμματιστής της εταιρείας Max Hudlberger, τα νέα συστήματα είναι αμφίδρομα, περιορίζοντας τις καθυστερήσεις που μέχρι σήμερα έκαναν πολλές συνομιλίες με ψηφιακούς βοηθούς να μοιάζουν αφύσικες.

Το πλεονέκτημα της ομιλίας δεν είναι μόνο η ταχύτητα. Μέσω της φωνής μπορούν να μεταδοθούν πληροφορίες που χάνονται στο γραπτό κείμενο, όπως ο τόνος, η ένταση και οι συναισθηματικές αποχρώσεις.

Η DeepL θέλει να εξαφανίσει το γλωσσικό εμπόδιο

Στη μάχη μπαίνει δυναμικά και η DeepL, επιχειρώντας να μεταφέρει την ισχυρή παρουσία της στη γραπτή μετάφραση στον προφορικό λόγο.

Με το DeepL Voice, η εταιρεία προσφέρει σχεδόν ταυτόχρονη μετάφραση συνομιλιών. Η τεχνολογία μπορεί να ενσωματωθεί σε τηλεδιασκέψεις, στην εξυπηρέτηση πελατών και σε εταιρικές εφαρμογές, επιτρέποντας για παράδειγμα σε δύο ανθρώπους που μιλούν διαφορετικές γλώσσες να συνομιλούν μέσω Teams στη μητρική τους γλώσσα.

Ο ιδρυτής της DeepL, Jarek Kutylowski, εξηγεί στη Handelsblatt ότι στόχος είναι η γλώσσα να πάψει να αποτελεί περιορισμό για τις επιχειρήσεις.

Σε ορισμένες εταιρικές περιπτώσεις που περιγράφει, συσκέψεις στις οποίες οι εργαζόμενοι χρησιμοποιούσαν προηγουμένως σπαστά αγγλικά πραγματοποιούνται πλέον στις μητρικές γλώσσες των συμμετεχόντων, με τον απαιτούμενο χρόνο να μειώνεται έως και 50%.

Πιθανές εφαρμογές δεν περιορίζονται στις τηλεδιασκέψεις. Η εταιρεία εξετάζει ακόμη και τη χρήση της τεχνολογίας σε συστήματα έκτακτης ανάγκης αυτοκινήτων, όπου η αυτόματη μετάφραση θα μπορούσε να ξεπεράσει το γλωσσικό εμπόδιο όταν κάποιος οδηγός βρίσκεται σε άλλη χώρα.

Η φωνή έχει ακόμη ένα μεγάλο πρόβλημα

Παρά την επενδυτική έκρηξη, η τεχνολογία απέχει ακόμη από το να θεωρείται ώριμη. Η επεξεργασία της ομιλίας είναι σημαντικά πιο σύνθετη από εκείνη του κειμένου, καθώς απαιτεί πολλά συστήματα να λειτουργούν ταυτόχρονα και με εξαιρετικά χαμηλή καθυστέρηση.

Στην κλασική προσέγγιση, το σύστημα πρέπει πρώτα να μετατρέψει την ομιλία σε κείμενο, στη συνέχεια να επεξεργαστεί το αίτημα μέσω του γλωσσικού μοντέλου και τέλος να μετατρέψει ξανά την απάντηση σε φωνή. Κάθε στάδιο προσθέτει χρόνο.

Γι’ αυτό και OpenAI, Google, DeepL και ElevenLabs επενδύουν σε μοντέλα που περιορίζουν τα ενδιάμεσα βήματα και μπορούν να αντιδρούν σχεδόν σε πραγματικό χρόνο.

Το πρόβλημα είναι ιδιαίτερα εμφανές στις τηλεφωνικές υπηρεσίες. Ακόμη και μια μικρή καθυστέρηση αρκεί για να κάνει μια συνομιλία να φαίνεται αφύσικη, ενώ οι χρήστες εξακολουθούν συχνά να έρχονται αντιμέτωποι με φωνητικούς βοηθούς που δεν κατανοούν σωστά τα αιτήματά τους ή εγκλωβίζονται σε δύσκαμπτους διαλόγους.

Όμως η κατεύθυνση της αγοράς φαίνεται σαφής. Αυτό που πριν από λίγα χρόνια αποτελούσε ένα πειραματικό εργαλείο αρχίζει πλέον να ενσωματώνεται σε κρίσιμες επιχειρηματικές διαδικασίες. Και οι τεχνολογικοί όμιλοι ποντάρουν ότι, όσο τα μοντέλα γίνονται γρηγορότερα και πιο φυσικά, η φωνή θα εξελιχθεί από συμπληρωματικό χαρακτηριστικό σε βασική διεπαφή της τεχνητής νοημοσύνης.

Το πραγματικό στοίχημα των δισεκατομμυρίων, επομένως, δεν είναι απλώς να μάθουν οι μηχανές να μιλούν. Είναι να πείσουν τους ανθρώπους ότι στο μέλλον δεν θα χρειάζεται καν να πληκτρολογούν.