現場でモコボイスを使う様子

Vertrauen von führenden Unternehmen & Institutionen

  • 大阪府立病院機構
  • 広島大学
  • 公益財団法人 颯田医学奨学会
  • 株式会社ロココ
  • askhub
  • 白河商工会議所
  • トヨタカローラネッツ岐阜
  • 医療法人社団親和会
  • 九州産業運輸株式会社

Spracherkennungs-KI,entwickelt für Lärmund Fachbegriffe.

Zeigt Genauigkeit in langen Meetings, bei Fachbegriffen und in lauten Umgebungen

Transkription in lauten Umgebungen

Zeichengenauigkeitsrate für 1-stündiges Audio · Höher ist besser

Transkript des Beispiel-Audios (allen Bedingungen gemeinsam)

1-stündiges Audio · Leseskript

Heute möchten wir bezüglich des ersten Falls mit einer detaillierten Kreditprüfung aus der Perspektive des Kreditmanagements fortfahren. Das Ziel ist ein Autoteile-Hersteller, der Mittel für neue Kapitalinvestitionen sucht.

10x Lärm: mocoVoice 86.56%, Gemini 3.1 Pro 57.25%, GPT-transcribe 46.73%, Whisper large-v3-turbo 71.99%

Fachbegriffe über lange Zeiträume

Rückrufquote von Fachbegriffen · Höher ist besser

8 Stunden (622 Vorkommen): mocoVoice 90.84%, Gemini 3.1 Pro 0.16%, GPT-transcribe 66.88%, Whisper large-v3-turbo 50.32%

Bewertet durch Hinzufügen von künstlichem Lärm zu 1-stündigem Audio und Spezifizierung eines 100-Wörter-Wörterbuchs. Die Zeichengenauigkeitsrate beträgt 100% abzüglich der Zeichenfehlerrate (CER). Der Lärmmultiplikator ist das Leistungsverhältnis zum Audio.

Fachbegriffe: Kein Wörterbuch oder Lärm hinzugefügt. Rückrufquote basierend auf der Häufigkeit von 100 festgelegten Wörtern. Bewertet mit synthetischem Audio aus mehreren Branchen. Gemini erlebte Auslassungen in Transkriptionen bei langem Audio, was die Rückrufquote von Fachbegriffen reduzierte.

2026.09.08 / Verglichen mit synthetischem Audio für die Finanz-, Medizin-, Bau- und Fertigungsindustrie

Transkription

Transkribieren Sie, wer was gesagt hat, selbst an lauten Einsatzorten.

Demo zum Hochladen von Audio- und Videodateien mit mocoVoice

Click to expand

View use cases and features
Use cases
Nehmen Sie Schichtübergaben, Morgenbesprechungen und Feldberichte sofort auf und speichern Sie sie.
Key features
Geräuschunterdrückung・Sprechertrennung・Benutzerdefiniertes Vokabular

Protokolle & Berichte

Formatiert in Ihre üblichen Protokolle und Berichte.

Demo zur Auswahl eines Sprecher-Zeitstempels und zur Überprüfung des zugehörigen Transkripts

Click to expand

View use cases and features
Use cases
Überprüfen Sie schnell vergangene Schritte zur Fehlerbehebung oder Projektübergabehistorien.
Key features
Cross-RAG-Suche・Quellaudio・Zugriffskontrolle

RAG-Suche

Durchsuchen Sie vergangene Äußerungen, verifizieren Sie mit dem Originalaudio.

Demo zur Durchsuchung gesammelter Aufzeichnungen mittels Cross-RAG-Suche

Click to expand

View use cases and features
Use cases
Identifizieren Sie wiederkehrende Probleme in Meetings und an Standorten, um Managementstrategien und Verbesserungspläne zu informieren.
Key features
Kreuzanalyse・Themenextraktion・Quellenlinks

KONZEPT

Voice Lakehouse

Aufzeichnungen direkt in Protokolle,
Berichte und RAG-Suche.

Sammeln Sie Meeting- und Feld-Audio und verwandeln Sie es in Protokolle und Tagesberichte. Suchen Sie in einfacher Sprache, um die genaue Äußerung zusammen mit dem Original-Audio aufzurufen.

Voice Lakehouse
Handovers
On-site Meetings
Work Reports
Business Meetings & Interviews
Auto-generated minutes & reports
RAG search
Original audio playback

Die Nutzung ist unglaublich einfach.

Sehen Sie sich das Tutorial-Video an

VERTRAUEN

Transkriptions- und Protokoll-KI in Produktion

Beispiele für Protokolle und Tagesberichte, die aus Audio im Gesundheitswesen, in der Fertigung und im Bauwesen generiert wurden.

FUNKTIONEN

Finden Sie schnell, wer was gesagt hat.

Cross-RAG-Suche

Suchen Sie über vergangene Meetings und Verkaufsgespräche hinweg. Rufen Sie sofort ab, 'wer was wann gesagt hat', ohne in Dateien wühlen zu müssen.

Beispielbildschirm der Cross-RAG-Suche

Sprechertrennung & -identifikation

Trennt automatisch Sprecher und schätzt deren Namen. Klären Sie 'er hat gesagt, sie hat gesagt'-Streitigkeiten mit konkreten Aufzeichnungen.

Bild der Zuweisung von Sprechernamen an Meetingteilnehmer

Langzeitaudio

Verarbeiten Sie ganztägige Schulungen oder Ganztages-Feldaufzeichnungen ohne den Aufwand, Dateien aufteilen zu müssen.

Diagramm, das die Unterstützung für Aufzeichnungen über 8 Stunden zeigt

Spezialisiertes Wörterbuch

Registrieren Sie fachspezifischen Jargon. Das System lernt aus Korrekturen, um sich an die bevorzugte Terminologie Ihres Unternehmens anzupassen.

Vergleich vor und nach der Registrierung von Fachbegriffen

Benutzerdefinierte Zusammenfassungsformate

Laden Sie einfach Ihr Standardprotokollformat hoch. Minimieren Sie manuelle Formatierungen und erstellen Sie gleichzeitig leicht teilbare Dokumente.

Beispielbildschirm für benutzerdefinierte Zusammenfassungsformate

Quellverifizierung

Klicken Sie auf einen beliebigen Teil der Zusammenfassung, um direkt zum Originalaudio zu springen. Überprüfen Sie die Fakten, bevor Sie sie teilen.

Beispielbildschirm zur Quellverifizierung

Übersetzung für 99 Sprachen

Erkennt Gespräche, die Japanisch, Englisch und Chinesisch mischen, und macht sie mit Übersee-Hubs und internationalem Personal teilbar.

Bild der unterstützten Sprachen

Organisationsmanagement

Verwalten Sie Nutzung und Zugriff nach Hub, Abteilung oder Projekt. Starten Sie klein in einer Abteilung und skalieren Sie nahtlos unternehmensweit.

Beispielbildschirm für Organisationsmanagement

Aufnahme in lauten Umgebungen

Unterstützung bei der Auswahl der Aufnahmeausrüstung zur Sicherstellung klarer Audioqualität in Fabriken und auf Baustellen.

Browser-Aufnahme

Starten Sie die Aufnahme sofort aus Ihrem Browser – keine App erforderlich.

Word / PDF Export

Exportieren Sie in Formaten, die einfach zu verteilen und zu bearbeiten sind.

Slack- & E-Mail-Benachrichtigungen

Erhalten Sie nach Abschluss sofortige Benachrichtigungen, um vergessenes Teilen zu vermeiden.

Medizinisches Modell

Gemeinsam mit dem Hiroshima University Hospital entwickelt. Erkennt Krankheits- und Medikamentennamen.

On-Premise-Beratung

Beraten Sie sich mit uns über eine On-Premise-Bereitstellung zur Erfüllung strenger Sicherheitsanforderungen.

PLAN

Transkribieren Sie Ihr nächstes Meeting.

Zuerst ausprobieren

Keine Kreditkarte erforderlich

14 Tage kostenlos

0 €

  • Unbegrenzte Transkriptionszeit
  • Zugriff auf alle KI-Funktionen
  • Kostenloser Verleih von Aufnahmeausrüstung
  • Beinhaltet operativen Support
Kostenlos testen

Von der Abteilung bis zum gesamten Unternehmen

Enterprise-Plan

Individuelle Preisgestaltung

Zugeschnitten auf Ihre Nutzerzahl und Aufnahmezeit. Wir begleiten Sie von der Anforderungsanalyse bis zur vollständigen Einführung.

  • Sicheres Teilen im Team
  • RAG-Suche in vergangenem Audio
  • Export in Unternehmensvorlagen
  • Branchenspezifischer Support
Kontaktieren Sie uns

Alleine starten

Starter-Plan

690 ¥ / Monat

Erstellen Sie ein Konto und abonnieren Sie dann innerhalb der App.

  • Bis zu 200 Min. pro Monat
  • Limits für Protokoll-KI, Übersetzungs-KI, etc.
  • Für den individuellen Gebrauch
Konto erstellen
モコボイス オンプレ機器が入った専用ボックス

On-Premise Protokoll-KI,bereit in nur 5 Werktagen.

Ein neu entwickeltes On-Premise-mocoVoice für Organisationen, die die Cloud nicht nutzen können, verfügbar ab August 2026.

  • Hohe Sicherheit
  • Für Offline-Arbeitsplätze
  • Medizinisches Modell verfügbar
Testversion besprechen

DOKUMENT

Holen Sie sich das vollständige Bild des
Einsatzes an vorderster Front in einer Broschüre.

Eine prägnante Zusammenfassung von allem, was Sie für die interne Überprüfung benötigen.

mocoVoice Produktbroschüre Cover

Funktionen, Erfolgsgeschichten,
& Sicherheit

Kostenlos herunterladen →

Häufig gestellte Fragen

Q.Wie unterscheidet sich das von ChatGPT oder Gemini?+

Während ChatGPT und Gemini hervorragend bei der allgemeinen Informationsbeschaffung und Textgenerierung sind, ist mocoVoice eine sprachzentrierte KI, die für den Aufbau und die Suche nach organisatorischem Wissen optimiert ist und Audio von der Frontlinie mit transkribiertem Text verknüpft.

Wir bieten eine Komplettlösung von der feldspezifischen KI – einschließlich unseres mit dem Hiroshima University Hospital entwickelten medizinischen Modells – bis zur Software selbst. Neben dem Umgang mit Fachterminologie und benutzerdefinierten Exportformaten lässt sich mocoVoice nahtlos in tatsächliche Arbeitsabläufe mit robusten Zugriffskontroll- und Team-Sharing-Funktionen integrieren.

Der größte Vorteil ist die Möglichkeit, direkt aus den RAG-Suchergebnissen oder KI-generierten Protokollen sofort auf die 'Quell-Audiodaten' zuzugreifen. Dies minimiert das Risiko von KI-Halluzinationen und unterstützt Entscheidungen, die auf zuverlässigen Primärdaten beruhen.

Q.Kann es in lauten Umgebungen verwendet werden?+

Ja. mocoVoice ist eine Spracherkennungs-KI, die speziell für die Frontlinie entwickelt wurde, nicht nur für ruhige Konferenzräume. Es wird aktiv in Bau-, Fertigungs- und Gesundheitsumgebungen eingesetzt. Für besonders herausfordernde Bedingungen bieten wir während Ihrer Testphase kostenlose Leihgeräte für geeignete Aufnahmeausrüstung an, damit Sie die Genauigkeit mit Ihrem eigenen Feld-Audio bewerten können, bevor Sie sich entscheiden.

Q.Wie unterscheidet es sich von einem Standard-KI-Meeting-Transkriptionstool?+

mocoVoice ist ein Spracherkennungs-KI-Service, der auf Workflows an der Frontlinie zugeschnitten ist. Es ist mehr als nur ein KI-Zusammenfassungstool; es unterstützt leistungsstark den Betrieb über Abteilungen und Hubs hinweg, insbesondere in Bereichen wie Gesundheitswesen, Bauwesen und Finanzen, in denen Fachterminologie konstant vorhanden ist.

Wir bieten alle notwendigen Funktionen für die reale Bereitstellung an einem Ort: spezialisierte Wörterbücher, ein medizinisches Modell, benutzerdefinierte Meeting-Vorlagen, Sprechertrennung, Geräuschunterdrückung, Ausrüstungsberatung, strenge Zugriffskontrolle und Cross-RAG-Suche.

Das größte Unterscheidungsmerkmal ist, dass Sie immer auf das 'Original-Quellaudio' zugreifen können, das die KI-generierten Ergebnisse stützt. Dies ermöglicht eine genaue Überprüfung und Entscheidungsfindung basierend auf äußerst zuverlässigen Primärinformationen, anstatt sich auf KI-Rätselraten zu verlassen.

Q.Wie genau ist mocoVoice?+

Es erreicht eine Genauigkeitsrate von 95,16% bei einem privaten Datensatz aus dem Finanzsektor (unter Verwendung des allgemeinen Modells, Stand 7. Juli 2025). Selbst in Bereichen mit viel Fachjargon wie Gesundheitswesen, Bauwesen und Finanzen kann die Genauigkeit durch automatisierte Wörterbuchregistrierung und anwendungsspezifisches Tuning weiter erhöht werden.

Q.Kann es mit Fachterminologie in den Bereichen Gesundheitswesen, Bauwesen usw. umgehen?+

mocoVoice erreicht in verschiedenen Branchen mithilfe eines proprietären Kontextverständnis-Algorithmus eine hohe Genauigkeit. Für Eigennamen und noch tieferes Verständnis von Fachjargon unterstützen wir automatisierte Wörterbuchregistrierung und benutzerdefinierte Zusammenfassungsformate. Für den medizinischen Bereich bieten wir während der Testphase ein dediziertes medizinisches Modell an. Wir empfehlen dringend, es während einer Testphase mit Ihrem tatsächlichen Feld-Audio auszuprobieren.

Q.Kann ich meine eigene Aufnahmeausrüstung verwenden?+

Ja, Sie können einen PC, ein Smartphone oder vorhandene Audiodateien verwenden. Wenn Sie eine stabile Aufzeichnung in Konferenzräumen oder vor Ort benötigen, können Sie gerne Ihre eigenen Aufnahmegeräte auswählen und verwenden.

Q.Unterstützen Sie das Transkribieren von M4A-Dateien?+

Ja. Wir unterstützen eine Vielzahl von Dateiformaten, einschließlich M4A, MP4 und MOV. Sie können problemlos Smartphone-Aufnahmen, Diktiergerät-Audio und Web-Meeting-Videodateien hochladen und transkribieren.

Q.Bieten Sie ein Agentur-/Reseller-Programm an?+
Wir freuen uns über Anfragen von Agenturen und Vertriebspartnern. Für Details zu Konditionen und Vertriebsvorschlägen kontaktieren Sie uns bitte über das Kontaktformular.