VoxFrame FAQ

Produktinformation

Häufige Fragen

Klare Antworten zu VoxFrame, Preisen, unterstützten Funktionen und sicherer Auslieferung.

Hier beginnen

Einstieg und Veröffentlichung

Wofür ist VoxFrame gedacht?

VoxFrame ist ein Windows-Videoplayer, der rund um Untertitel entwickelt wurde. Er spielt lokale Videos und legale IPTV-/Live-Streams ab, sucht zuerst nach vorhandenen menschlichen Untertiteln und kann übersetzen, synchronisieren oder transkribieren, wenn kein brauchbarer Untertitel vorhanden ist.

Zusätzlich bietet VoxFrame Qualitätsprüfung, Reparatur- und Review-Werkzeuge, Export, LAN Watch und separate Cast-Unterstützung.

Kann ich VoxFrame bereits öffentlich herunterladen?

Noch nicht. Öffentliche Kundendownloads werden geöffnet, nachdem der Installer signiert wurde und die letzten Releaseprüfungen bestanden sind.

Bis dahin laufen Testbuilds über den geschützten Account und die In-App-Updatewege; sie dürfen nicht weitergegeben werden.

Welche Dateien werden unterstützt?

Lokale Videos: MP4, MKV, AVI, MOV, WebM, M4V und TS. Untertiteldateien: SRT, VTT, WebVTT, ASS und SSA.

Für IPTV kann VoxFrame legale M3U/M3U8-Playlists und unterstützte direkte Stream-URLs öffnen. VoxFrame umgeht weder DRM noch Zugangsbeschränkungen.

Menschliche Untertitel zuerst

Untertitelwege

Wie wählt Subtitle Assistant einen Untertitel?

VoxFrame prüft zuerst eingebettete Tracks und lokale Sidecar-Dateien. Danach sucht die App bei OpenSubtitles in der gewählten Sprache. Fehlt diese Sprache, kann ein geeigneter menschlicher englischer Untertitel übersetzt werden. Speech-to-Text-Erzeugung ist der letzte Fallback.

Ausgewählte Quelle, Sprache und Match-Confidence bleiben sichtbar, damit die Auswahl überprüft werden kann.

Funktioniert Live-Transkript bei lokalen Videos?

Nein. Live transcript / translate ist für IPTV-/Live-Streams gedacht. Lokale Videos verwenden die normalen Untertitel-Workflows: Suche, AI-Untertitel erzeugen, mit Fast STT synchronisieren, übersetzen, reparieren und exportieren.

Synchronisierte Captions

Live-IPTV

Welche Live-Untertitelkonfiguration soll ich wählen?
  • Lokale beste Qualität - empfohlen: die stärkste lokal getestete Konfiguration. Audio bleibt auf diesem PC, ein geeigneter PC/GPU wird empfohlen und die synchronisierte Wiedergabe startet mindestens 35 Sekunden hinter Live.
  • Lokale leichtere Konfiguration - schwächerer PC/GPU: verwendet das gewählte lokale Sprachmodell mit einer leichteren Live-Konfiguration und mindestens 30 Sekunden Synchronisationspuffer.
  • Eigene OpenAI-API - direkt: sendet Live-Audio mit Ihrem gespeicherten Key direkt an OpenAI und verwendet mindestens 30 Sekunden Synchronisationspuffer. Die Option erscheint, wenn VoxFrame Cloud ausgeschaltet und ein Key gespeichert ist.
  • Cloud synchronisierte Qualität - empfohlen: das erste von genau zwei Cloud-Profilen; verarbeitet 10-Sekunden-Sprachblöcke über VoxFrame Cloud.
  • Cloud mit längerem Dialogkontext: das zweite Cloud-Profil; verwendet 12-Sekunden-Blöcke für mehr Kontext, erkennt aber keine Sprecher.

Cloud-Profile erscheinen nur, wenn der Account VoxFrame Cloud verwenden darf. Für lokale Profile müssen eine lokale STT-Engine und ein Modell installiert sein.

Warum ist die Live-Wiedergabe verzögert?

Die Verzögerung ist beabsichtigt: Video, Audio und Captions verwenden eine gemeinsame gepufferte Zeitlinie. Lokale beste Qualität startet mindestens 35 Sekunden hinter Live; Lokale leichtere Konfiguration und Eigene OpenAI-API - direkt starten mindestens 30 Sekunden dahinter. Cloud startet mindestens 60 Sekunden hinter Live. Transkriptions- und eventuelle Übersetzungszeit kommen zu diesen Puffern hinzu.

Die Einstellung 0 / +1 / +2 / +3 / +5 Sekunden verschiebt Captions nur weiter nach hinten; der Synchronisationspuffer wird dadurch nicht kürzer.

Erstellt ein Live-Stream eine SRT-Datei?

Nein. Live-Captions werden während der aktiven Sitzung im Speicher gehalten und als Overlay angezeigt. VoxFrame erstellt oder speichert keine Live-SRT. Temporäre Audio- und Pufferdateien werden nach dem Stoppen entfernt.

Eine aktive LAN-Watch-Sitzung kann Captions vorübergehend als WebVTT mitführen, aber das ist keine normale herunterladbare Live-Untertiteldatei.

Was bedeutet die Musiknote?

Das Symbol bedeutet, dass die Spracherkennung ausdrücklich ein Musiklabel zurückgegeben hat. VoxFrame normalisiert kurze Angaben wie „music“ oder „[background music]“ zu diesem Symbol. Titel oder Interpret werden nicht erkannt.

Erkennt Cloud mit längerem Dialogkontext Sprecher?

Nein. Das Cloud-Profil mit längerem Dialogkontext gibt der Transkription einen etwas längeren Audioblock, führt aber keine Sprechertrennung durch und benennt oder markiert keine Sprecher.

Kann ich die Zielsprache während Live-Wiedergabe ändern?

Ja. Neue Blöcke verwenden die neu gewählte Zielsprache, ohne den Stream neu zu starten. Bereits angezeigte Captions werden nicht erneut übersetzt.

Route auswählen

Datenschutz und Kosten

Brauche ich Premium Cloud?

Nein. VoxFrame bleibt mit lokalen Funktionen und eigenen Provider-Zugangsdaten nutzbar. Premium Cloud ist optional. Ein direkter qualifizierender Cloud-Kauf schaltet Player Pro automatisch mit frei; ein vorheriger separater Player-Kauf ist nicht nötig.

Was ist der Unterschied zwischen lokal, eigener API und Cloud?
  • Lokal: Speech-to-Text läuft auf diesem PC; die Geschwindigkeit hängt vom installierten Modell und der Hardware ab.
  • Eigene API: unterstützte Anfragen gehen mit Ihrem Key direkt an den Provider; dieser rechnet die Nutzung mit Ihnen ab.
  • VoxFrame Cloud: unterstützte Anfragen verwenden die gemessene VoxFrame-Serverroute, ohne einen VoxFrame-Providerkey in der App offenzulegen.
Wohin werden meine Audiodaten gesendet?

Bei einem lokalen Live-Profil bleibt die Audioverarbeitung auf dem PC. Bei Eigene OpenAI-API - direkt gehen Audioblöcke direkt an OpenAI und werden über Ihr OpenAI-Konto abgerechnet; VoxFrame-Cloud-Guthaben wird nicht verwendet. Bei einem Cloud-Profil werden Audioblöcke per HTTPS an VoxFrame zur OpenAI-Verarbeitung gesendet.

Cloud-Transkriptionsverbrauch wird nach einer erfolgreichen Transkription gebucht. Live-Übersetzung ist ein separater Verarbeitungsschritt.

Auf jedem Bildschirm

LAN Watch und Cast

Was ist der Unterschied zwischen LAN Watch und Chromecast?

LAN Watch startet einen temporären HLS-Webplayer und zeigt einen Link sowie QR-Code für einen Browser im selben lokalen Netzwerk. Das ist die primäre Route für Browser, Telefon, Tablet und TV-Browser.

Chromecast, Google TV und DLNA sind separate Geräterouten. Verfügbarkeit und Untertitelkompatibilität hängen vom tatsächlichen Gerät, Netzwerk und Mediencodec ab; nicht jeder Fernseher und jedes Format werden garantiert unterstützt.

Wenn etwas nicht funktioniert

Fehlerbehebung und Support

Warum fehlt manchmal eine Zeile oder warum stoppen Captions?

Spracherkennung ist nicht wortgenau. Stille, Musik, undeutliche Sprache, ein überlasteter PC, ein langsamer Provider oder ein instabiler Stream können einen leeren oder verspäteten Block verursachen. Ein Block, dessen Wiedergabefenster bereits vorbei ist, kann übersprungen werden, um dauerhafte Verzögerung zu verhindern.

Lokale und Own-Key-Eingaben werden in Echtzeit gelesen, um eine Startüberflutung zu vermeiden. Ein einzelner lokaler Transkriptionsfehler kann eine kurze Lücke verursachen, während die Sitzung weiterläuft; drei aufeinanderfolgende lokale Providerfehler stoppen den Live-Workflow. Die direkte Own-Key-Anzeige hält kurze schnelle Cues mindestens etwa 1,4 Sekunden sichtbar und kann bis zu drei dicht aufeinanderfolgende Cues behalten; eine echte Pause von mehr als ungefähr 0,8 Sekunden beendet diesen rollenden Verlauf. Bekannte kurze falsche Credit-Texte werden gefiltert, VoxFrame kann aber keine Sprache rekonstruieren, die der Provider nicht transkribiert hat.

Was bedeuten Listening, No speech yet und Failed?
  • Listening: Die Live-Sitzung läuft und wartet auf verwertbare Sprache.
  • No speech yet: Blöcke wurden geprüft, aber keine klare Sprache gefunden; das ist nicht automatisch ein Fehler.
  • Degraded: Ein Teil des Workflows ist vorübergehend eingeschränkt; Quell-Captions können weiterlaufen, wenn die Übersetzung zurückfällt.
  • Reconnecting: VoxFrame unternimmt einen begrenzten neuen Versuch.
  • Failed: Ein technisches Problem hat den Live-Workflow gestoppt.
Was soll ich an den Support senden?

Senden Sie Appversion, gestartete Aktion, ausgewähltes lokales/Own-Key-/Cloud-Profil, gesprochene Sprache und Zielsprache, den genauen sichtbaren Status und ein bereinigtes Supportlog aus Settings > About > Export safe support log.

Senden Sie niemals Lizenzschlüssel, Provider-Keys, Zugriffstokens, Zahlungsdaten oder nicht relevante persönliche Dateien.