Sådan aktiverer du DVB og billedundertekstekstraktion

MCEBuddy kan automatisk konvertere billedbaserede undertekster (f.eks. DVB eller indbrændte undertekster) til en tekstundertekst (SRT) ved hjælp af OCR (Optical Character Recognition). Denne funktion kræver, at yderligere filer downloades, fordi OCR-behandling kræver meget store datafiler (~1 GB i størrelse), som ikke kan inkluderes i MCEBuddy-installationsfilen.


MCEBuddy Version 2.7.1 og nyere

OCR-filerne downloades og installeres automatisk, hvis der er en internetforbindelse tilgængelig, efter MCEBuddy-installationen er fuldført.


MCEBuddy Version 2.6.2 til 2.6.6

Under installationen er muligheden for automatisk at downloade og installere de nødvendige OCR-tilføjselsfiler aktiveret som standard. Du kan deaktivere det, hvis du ikke ønsker, at OCR-tilføjselsfilerne downloades og installeres automatisk.

Hvis downloadet mislykkedes på grund af manglende internetforbindelse, eller du ikke valgte automatisk installation under opsætningen, kan du til enhver tid udløse en automatisk geninstallation af OCR-tilføjselsfilerne ved at klikke på linket Install OCR add-on på siden Konverteringsopgave som vist nedenfor:

InstallOCR add-on i grå betyder, at tilføjselsfilerne er installeret. Klik på teksten for at downloade og geninstallere dem (~500 MB download)
Install OCR add-on i rød betyder, at tilføjselsfilerne endnu ikke er installeret. Klik på teksten for at downloade og installere dem (~500 MB download)

Sørg for, at Save subtitles eller Embed subtitles er aktiveret i Konverteringsopgave → Avancerede indstillinger for at udtrække og behandle undertekster ved hjælp af OCR.


MCEBuddy Versioner 2.4.7 til 2.6.1

Du skal manuelt downloade og installere OCR-filerne som beskrevet nedenfor.

Følg nedenstående procedure for at aktivere OCR og konvertering af billeder til tekstundertekster for at udtrække DVB og andre billedbaserede undertekster fra optagelser.

  1. Download OCR-filerne fra https://github.com/tesseract-ocr/tessdata/archive/3.04.00.zip
  2. Pak indholdet af zip-filen ud (tessdata-3.04.00.zip). Det bør oprette en mappe kaldet tessdata-3.04.00, inde i hvilken der vil være 100+ traineddata-filer. Sørg for, at der ikke er undermapper. Det bør se sådan ud: tessdata-3.04.00\\<100+ traineddata-filer>
  3. Flyt mappen tessdata-3.04.00 ind i ccextractor-mappen, hvor MCEBuddy er installeret: _\ccextractor_
    f.eks. Flyt tessdata-3.04.00 ind i C:\Program Files\MCEBuddy2x\ccextractor\
  4. Omdøb mappen tessdata-3.04.00 til tessdata. Vigtigt: Må ikke springe dette trin over, ellers virker OCR ikke

Så din endelige opsætning bør se sådan ud: \ccextractor\tessdata\<100+ traineddata-filer>
f.eks. C:\Program Files\MCEBuddy2x\ccextractor\tessdata\<100+ traineddata-filer>

Sørg for, at du har aktiveret muligheden Extract subtitles and closed captions i dine Konverteringsopgaves avancerede indstillinger, og så er du klar! Det vil udtrække og konvertere billedbaserede undertekster til en tekst-SRT-fil. God fornøjelse!


Versioner ældre end 2.4.7 understøtter ikke OCR

Understøttes Tessdata 4.x eller 5.x (alpha) af MCEBuddy, og kan det installeres på samme måde/sted?

Der er yderligere undermapper i både 4- og 5-versionerne af opdateringerne.

Tessdata bruges af ccExtractor, og det understøtter endnu ikke 4.x eller 5.x

Godt at vide, tak. Det sparede mig meget tid. :slight_smile:

Jeg downloadede zip-filen, og den er tom. Jeg prøver igen.

skulle bruge 7-zip. windows kunne ikke pakke den ud

Opdatering, startende med version 2.7.1 vil MCEBuddy understøtte tessdata for tesseract 4.x og 5.x. Standard tessdata-filerne, der downloades, vil stadig være til 3.04, da vi i vores test fandt, at disse var bedst til OCR i indbrændte video- og billedtekster, men du kan eksperimentere med dine egne tessdata-trænede filer, hvis du er interesseret.

Bemærkninger:

  • Standardindstillingen er altid PSM-tilstand 3, men OEM-tilstanden skifter til LTSM, når der bruges tessdata til 4.x og 5.x, og LEGACY, når der bruges tessdata til 3.x
  • Mappestrukturen forbliver den samme for alle versioner; alle de trænede datafiler skal placeres i en mappe kaldet tessdata som beskrevet i instruktionerne ovenfor

Hvis du opdager, at brug af en anden PSM- eller OEM-tilstand virker bedre, så lad os vide detaljerne med eksempler, og vi vil undersøge muligheden for at lade brugere tilpasse tilstandene.

Her er nogle links til de forskellige tessdata-trænede filer, der er kompatible med tesseract 4.x og 5.x, som er blevet testet med MCEBuddy