Post Thumbnail

HuggingFace und IISc erstellen Sprachdatenbank Indiens

HuggingFace und das Indian Institute of Science (IISc) haben eine Partnerschaft angekündigt, die Vaani, den größten multimodalen und mehrsprachigen Datensatz Indiens, Entwicklern weltweit zugänglich machen wird. Das Projekt zielt darauf ab, inklusive KI-Technologien zu schaffen, die die sprachliche und kulturelle Vielfalt des Landes berücksichtigen.

Das Vaani-Projekt, das 2022 gemeinsam von IISc/ARTPARK und Google gestartet wurde, setzt sich ein ehrgeiziges Ziel: mehr als 150.000 Stunden Sprache und 15.000 Stunden transkribierter Text von 1 Million Menschen in allen 773 Bezirken Indiens zu sammeln. Die Einzigartigkeit des Projekts liegt in seinem geozentrischen Ansatz, der es ermöglicht, Daten über Dialekte und Sprachen zu sammeln, die in abgelegenen Regionen verwendet werden, nicht nur über Mainstream-Sprachen.

Gegenwärtig wird das Projekt in Phasen umgesetzt. Die erste Phase, die 80 Bezirke umfasst, ist bereits abgeschlossen, und die Daten sind öffentlich zugänglich. Die zweite Phase läuft jetzt und erweitert die Abdeckung um weitere 100 Bezirke.

Mit Stand vom 15. Februar 2025 umfasst der offene Teil des Datensatzes eine transkribierte Teilmenge mit 790 Stunden Audio von etwa 700.000 Sprechern und deckt 70.000 Bilder ab. Diese Ressource ist für verschiedene Aufgaben bestimmt, darunter:
– Spracherkennung: Training von Modellen für die genaue Transkription gesprochener Sprache
– Sprachmodellierung: Erstellung fortschrittlicherer Sprachmodelle
– Segmentierung: Identifizierung einzelner Spracheinheiten zur Verbesserung der Transkriptionsgenauigkeit

Die Partnerschaft zwischen HuggingFace und IISc/ARTPARK zielt darauf ab, die Zugänglichkeit und Benutzerfreundlichkeit des Vaani-Datensatzes zu erhöhen, was zur Entwicklung von KI-Systemen beitragen sollte, die die Vielfalt der indischen Sprachen besser verstehen und den digitalen Bedürfnissen der Bevölkerung des Landes gerecht werden.

Dieses Projekt stellt einen wichtigen Schritt bei der Demokratisierung von KI-Technologien und der Schaffung inklusiverer Lösungen dar, die die sprachliche Vielfalt eines der größten Länder der Welt berücksichtigen.

Autor: AIvengo
Seit 5 Jahren arbeite ich mit maschinellem Lernen und künstlicher Intelligenz. Und dieser Bereich hört nicht auf, mich zu überraschen, zu begeistern und zu interessieren.

Latest News

NVIDIA konnte KI-Chips nicht verkaufen, bis OpenAI auftauchte

NVIDIA-Chef Jensen Huang teilte eine interessante Geschichte, die heute wie ein schicksalhafter Moment in der Entwicklung moderner Technologien aussieht.

Pudu Robotics veröffentlichte CC1 Pro — Roboter reinigt 8000 m² pro Zyklus

Das Unternehmen Pudu Robotics stellte eine neue Generation autonomer Reinigungssysteme vor — CC1 Pro. Der die Sauberkeitsstandards in großen kommerziellen Objekten auf ein grundlegend neues Niveau hebt.

Boston Dynamics veröffentlichte Orbit 5.0 — KI reduzierte Inspektionen um 70%

Ein cooles Update Orbit 5.0 für die Robotersteuerungsplattform Spot von Boston Dynamics ist erschienen. Das den Ansatz zur industriellen Analytik und Überwachung grundlegend verändert! Das System ermöglicht nun die zentrale Kontrolle ganzer Roboterflotten an mehreren Standorten und bietet Bedienern detaillierte Echtzeit-Analytik.

Abu Dhabi wird $2,5 Milliarden für eine KI-gesteuerte Stadt bis 2027 ausgeben

Stellen Sie sich eine Stadt vor, in der künstliche Intelligenz sich um jeden Aspekt Ihres Lebens kümmert. Das ist keine Science-Fiction, sondern die nahe Zukunft von Abu Dhabi! Die Unternehmen BOLD Technologies und My Aion entwickeln eine einheitliche Plattform Aion Sentia. Die alle städtischen Systeme unter Kontrolle nehmen wird — von Transport bis Gesundheitswesen und Bildung.

4 chinesische Ingenieure schmuggelten 80 TB KI-Daten in Rucksäcken nach Malaysia

Eine unglaubliche technologische Odyssee entfaltet sich gerade jetzt! Chinesische Ingenieure fanden einen erstaunlich analogen Weg, digitale Beschränkungen zu umgehen. Stellen Sie sich vor: 4 Mitarbeiter eines chinesischen KI-Startups fliegen von Peking nach Kuala Lumpur. Und jeder trägt 15 Festplatten in seinem Rucksack! Insgesamt — 80 Terabyte Daten für das Training neuronaler Netze.