Veliki deo svetske populacije i dalje koristi jezike i dijalekte koji su slabo zastupljeni u sistemima veštačke inteligencije, što može da dovede do lošijih prevoda, netačnih odgovora i nejednakog pristupa novim tehnologijama.
Koalicija koju čini 60 tehnoloških kompanija, organizacija i fondacija radiće na stvaranju reprezentativnijih jezičkih baza podataka kako bi sistemi veštačke inteligencije bolje razumeli jezike koji su trenutno nedovoljno zastupljeni.
Među partnerima su Anthropic, Google i OpenAI Fondacija, a inicijativa ima cilj da u narednih pet godina doprinese boljoj dostupnosti AI tehnologije za više od tri milijarde ljudi.
Više jezika u AI sistemima
Problem je u tome što su mnogi današnji AI sistemi obučavani na sadržajima dostupnim na internetu, gde veliki broj jezika, lokalnih izraza i dijalekata nema dovoljno kvalitetnih podataka.
To može biti posebno važno u oblastima poput zdravstva, obrazovanja i poljoprivrede, gde pogrešan prevod ili nerazumevanje lokalnog izraza može imati ozbiljne posledice.
Jedan od već postojećih projekata prikupljanja jezičkih podataka u Indiji (Project Vaani) prikupio je više od 150.000 sati govornih zapisa, uključujući različite regionalne jezike i dijalekte.








































