Mit ML Kit unter Android die Sprache eines Textes ermitteln

Mit ML Kit können Sie die Sprache einer Textzeichenfolge ermitteln. Sie können die wahrscheinlichste Sprache des Strings sowie Konfidenzwerte für alle möglichen Sprachen des Strings abrufen.

ML Kit erkennt Texte in über 100 verschiedenen Sprachen in ihren Mutterskripts. Darüber hinaus kann romanisierter Text für Arabisch, Bulgarisch, Chinesisch, Griechisch, Hindi, Japanisch und Russisch erkannt werden. Eine vollständige Liste der unterstützten Sprachen und Skripts finden Sie in der vollständigen Liste.

GebündeltEntbündelt
Name der Bibliothekcom.google.mlkit:language-idcom.google.android.gms:play-services-mlkit-language-id
ImplementierungDas Modell ist zum Zeitpunkt der Build-Erstellung statisch mit Ihrer App verknüpft.Das Modell wird über die Google Play-Dienste dynamisch heruntergeladen.
Auswirkungen auf die App-GrößeGröße um ca. 900 KB erhöht.Größe um ca. 200 KB erhöht.
InitialisierungszeitDas Modell ist sofort verfügbar.Möglicherweise müssen Sie vor der ersten Verwendung warten, bis das Modell heruntergeladen ist.

Ausprobieren

  • Probieren Sie die Beispiel-App aus, um ein Beispiel für die Verwendung dieser API zu sehen.

Hinweis

  1. Fügen Sie in der Datei build.gradle auf Projektebene das Maven-Repository von Google in den Abschnitten buildscript und allprojects ein.

  2. Fügen Sie der Gradle-Datei auf App-Ebene Ihres Moduls die Abhängigkeiten für die ML Kit-Android-Bibliotheken hinzu. Diese ist in der Regel app/build.gradle. Wählen Sie je nach Ihren Anforderungen eine der folgenden Abhängigkeiten aus:

    So bündeln Sie das Modell mit Ihrer App:

    dependencies {
      // ...
      // Use this dependency to bundle the model with your app
      implementation 'com.google.mlkit:language-id:17.0.5'
    }
    

    Zur Verwendung des Modells in den Google Play-Diensten:

    dependencies {
      // ...
      // Use this dependency to use the dynamically downloaded model in Google Play Services
      implementation 'com.google.android.gms:play-services-mlkit-language-id:17.0.0'
    }
    
  3. Wenn Sie das Modell in den Google Play-Diensten verwenden, können Sie Ihre App so konfigurieren, dass das Modell nach der Installation aus dem Play Store automatisch auf das Gerät heruntergeladen wird. Fügen Sie dazu der Datei AndroidManifest.xml Ihrer App die folgende Deklaration hinzu:

    <application ...>
          ...
          <meta-data
              android:name="com.google.mlkit.vision.DEPENDENCIES"
              android:value="langid" >
          <!-- To use multiple models: android:value="langid,model2,model3" -->
    </application>
    

    Sie können die Modellverfügbarkeit auch explizit über die ModuleInstallClient API der Google Play-Dienste prüfen und den Download anfordern.

    Wenn Sie Modelldownloads bei der Installation nicht aktivieren und keinen expliziten Download anfordern, wird das Modell beim ersten Ausführen der ID heruntergeladen. Anfragen, die Sie vor dem Abschluss des Downloads stellen, generieren keine Ergebnisse.

Sprache eines Strings ermitteln

Zur Ermittlung der Sprache eines Strings rufen Sie LanguageIdentification.getClient() auf, um eine Instanz von LanguageIdentifier abzurufen, und übergeben den String dann an die Methode identifyLanguage() von LanguageIdentifier.

Beispiel:

Kotlin

val languageIdentifier = LanguageIdentification.getClient()
languageIdentifier.identifyLanguage(text)
        .addOnSuccessListener { languageCode ->
            if (languageCode == "und") {
                Log.i(TAG, "Can't identify language.")
            } else {
                Log.i(TAG, "Language: $languageCode")
            }
        }
        .addOnFailureListener {
            // Model couldn’t be loaded or other internal error.
            // ...
        }

Java

LanguageIdentifier languageIdentifier =
        LanguageIdentification.getClient();
languageIdentifier.identifyLanguage(text)
        .addOnSuccessListener(
                new OnSuccessListener<String>() {
                    @Override
                    public void onSuccess(@Nullable String languageCode) {
                        if (languageCode.equals("und")) {
                            Log.i(TAG, "Can't identify language.");
                        } else {
                            Log.i(TAG, "Language: " + languageCode);
                        }
                    }
                })
        .addOnFailureListener(
                new OnFailureListener() {
                    @Override
                    public void onFailure(@NonNull Exception e) {
                        // Model couldn’t be loaded or other internal error.
                        // ...
                    }
                });

Wenn der Aufruf erfolgreich ist, wird ein BCP-47-Sprachcode an den Erfolgs-Listener übergeben, der die Sprache des Textes angibt. Wenn keine Sprache sicher erkannt wird, wird der Code und (unbestimmt) übergeben.

Standardmäßig gibt ML Kit nur dann einen anderen Wert als und zurück, wenn die Sprache mit einem Konfidenzwert von mindestens 0,5 identifiziert wird. Sie können diesen Schwellenwert ändern, indem Sie ein LanguageIdentificationOptions-Objekt an getClient() übergeben:

Kotlin

val languageIdentifier = LanguageIdentification
        .getClient(LanguageIdentificationOptions.Builder()
                .setConfidenceThreshold(0.34f)
                .build())

Java

LanguageIdentifier languageIdentifier = LanguageIdentification.getClient(
        new LanguageIdentificationOptions.Builder()
                .setConfidenceThreshold(0.34f)
                .build());

Mögliche Sprachen eines Strings abrufen

Um die Konfidenzwerte der wahrscheinlichsten Sprachen eines Strings abzurufen, müssen Sie eine Instanz von LanguageIdentifier abrufen und den String dann an die Methode identifyPossibleLanguages() übergeben.

Beispiel:

Kotlin

val languageIdentifier = LanguageIdentification.getClient()
languageIdentifier.identifyPossibleLanguages(text)
        .addOnSuccessListener { identifiedLanguages ->
            for (identifiedLanguage in identifiedLanguages) {
                val language = identifiedLanguage.languageTag
                val confidence = identifiedLanguage.confidence
                Log.i(TAG, "$language $confidence")
            }
        }
        .addOnFailureListener {
            // Model couldn’t be loaded or other internal error.
            // ...
        }

Java

LanguageIdentifier languageIdentifier =
        LanguageIdentification.getClient();
languageIdentifier.identifyPossibleLanguages(text)
        .addOnSuccessListener(new OnSuccessListener<List<IdentifiedLanguage>>() {
            @Override
            public void onSuccess(List<IdentifiedLanguage> identifiedLanguages) {
                for (IdentifiedLanguage identifiedLanguage : identifiedLanguages) {
                    String language = identifiedLanguage.getLanguageTag();
                    float confidence = identifiedLanguage.getConfidence();
                    Log.i(TAG, language + " (" + confidence + ")");
                }
            }
        })
        .addOnFailureListener(
                new OnFailureListener() {
                    @Override
                    public void onFailure(@NonNull Exception e) {
                        // Model couldn’t be loaded or other internal error.
                        // ...
                    }
                });

Wenn der Aufruf erfolgreich ist, wird eine Liste von IdentifiedLanguage-Objekten an den Erfolgs-Listener übergeben. Von jedem Objekt können Sie den BCP-47-Code der Sprache und die Zuverlässigkeit des Strings in dieser Sprache abrufen. Diese Werte geben an, wie sicher der gesamte String in der angegebenen Sprache ist. ML Kit erkennt nicht mehrere Sprachen in einem einzelnen String.

Standardmäßig gibt ML Kit nur Sprachen mit Konfidenzwerten von mindestens 0, 01 zurück. Sie können diesen Grenzwert ändern, indem Sie ein LanguageIdentificationOptions-Objekt an getClient() übergeben:

Kotlin

val languageIdentifier = LanguageIdentification
      .getClient(LanguageIdentificationOptions.Builder()
              .setConfidenceThreshold(0.5f)
              .build())

Java

LanguageIdentifier languageIdentifier = LanguageIdentification.getClient(
      new LanguageIdentificationOptions.Builder()
              .setConfidenceThreshold(0.5f)
              .build());

Wenn dieser Grenzwert für keine Sprache erreicht wird, enthält die Liste ein Element mit dem Wert und.