Whisper van OpenAI is een nieuwe AI-aangedreven oplossing die je kan helpen je stem op een unieke manier om te zetten in tekst. Het beste van alles is dat het gratis is.
Er is echter een relatief klein probleem: installatie en gebruik zijn veel moeilijker met een normale Windows-tool. Zeker als je de Tensor cores van je Nvidia grafische kaart wilt gebruiken om hem een mooie boost te geven. Verifiëren De beste op AI gebaseerde tools om gratis fotokunst te maken van je schrijven.

Je moet echter niet wanhopen. Daarom zijn we hier! Lees verder om te leren hoe u het moet installeren en gebruiken, maar ook, als u een grafische kaart van Nvidia bezit, laten we u zien hoe Whisper hiervan kan profiteren.
Snelle links
Wat is Whisper van OpenAI?
ChatGPT wordt snel populair onder gebruikers en we hebben al gezien hoe u het kunt gebruiken ChatGPT door OpenAI. Het is echter niet het enige interessante project van OpenAI.
Aangedreven door deep learning en neurale netwerken, is Whisper een natuurlijk taalverwerkingssysteem dat spraak kan "begrijpen" en omzetten in tekst. Maar het beschikt ook over verschillende aangepaste configuraties in zijn vakgebied en presteert beter dan alle vergelijkbare oplossingen dankzij:
- Whisper is een kunstmatige intelligentie-oplossing die is "getraind" in natuurlijke taal. Het begrijpen van "normale" menselijke spraak is dus beter dan de oude oplossingen.
- Whisper wordt niet geleverd met een interface en kan ook geen audio opnemen. Het kan alleen bestaande audiobestanden gebruiken en tekstbestanden uitvoeren.
- Hoe goed het ook is in "de taal begrijpen", Whisper heeft ook absoluut het beste in automatische vertaling.
- Whisper is geen online dienst en kan volledig offline werken.
- Als u een grafische kaart van Nvidia (GTX970 of nieuwer) heeft, kan Whisper worden uitgevoerd in "hardware-versnelde modus" om de respons te versnellen.
- U hoeft zich niet te registreren, een licentie aan te schaffen of een abonnement aan te schaffen.
Waarom wordt AMD grafische kaart niet ondersteund?
Om GPU's bruikbaar te maken voor meer dan alleen grafische uitvoer, moeten ze functioneren als volledig programmeerbare processors. Daarom heeft Nvidia de CUDA-architectuur gemaakt, die officieel een "parallel computerplatform en programmeermodel" is.
CUDA is een gepatenteerde Nvidia-technologie, alleen compatibel met Nvidia GPU's. De beste alternatieven van AMD zijn OpenCL en Radeon Compute Platform.
In vergelijking met de alternatieven is CUDA volwassener, beter presterend en gebruiksvriendelijker. De meeste ontwikkelaars richten zich dus alleen op CUDA, wat op zijn beurt betekent dat hun applicaties alleen profiteren van hardwarefuncties op Nvidia GPU's. Dit is inclusief Whisper. Verifiëren AMD vs NVIDIA grafische kaarten Vergelijking op Linux: welke moet u gebruiken?
Whisper downloaden en installeren
Helaas is Whisper geen op zichzelf staande app die u normaal kunt downloaden, installeren en uitvoeren. Het hangt af van andere afhankelijkheden die ook moeten worden geïnstalleerd.
Voor Windows, om deze handleiding eenvoudig te houden, zullen we de alom populaire Chocolatey gebruiken om de meeste delen van de benodigde apps te installeren. Zie onze gids over De snelste manier om Windows-apps te installeren Voor meer informatie over Chocolatey.
Voor zowel Linux als Mac zou het installatieproces (behalve de Windows-padvariabele en handige batchbestanden die we zullen maken) vergelijkbaar moeten zijn.
- Om Whisper te installeren en te gebruiken, moeten Python en zijn PIP-tool worden geïnstalleerd en toegevoegd aan de Windows-variabele "Path". Voor informatie daarover, zie ons artikel over Hoe Python PIP op Windows te installeren و Mac en Linux.
- installeren FFMPEG Via Chocolatey met deze opdracht:
choco install ffmpeg

- Installeer ook de Python-versie met:
pip3 install python-ffmpeg
- Installeer ten slotte Whisper vanaf de Github-pagina met:
pip3 install git+https://github.com/openai/whisper.git
Download een CUDA-enabled versie van Whisper
Hoewel Whisper niet primair Nvidia-gpu's gebruikt, biedt het Torch-pakket waarop het is gebaseerd een CUDA-versnelde versie. Als u het gebruikt in plaats van de "gewone" versie van Whisper, kunnen transcripties sneller worden voltooid met behulp van een grafische kaart van Nvidia.
Voor Whisper, dat Nvidia's CUDA gebruikt:
- Als je de "vanille"-versie van Torch al hebt geïnstalleerd, verwijder deze dan en verwijder de overgebleven bestanden met behulp van:
pip3 uninstall torch
- Als u klaar bent, volgt u het op met de volgende opdracht:
pip cache purge
- Installeer Torch's CUDA-enabled versie met de opdracht:
pip3 install torch torchvision torchaudio — extra-index-url https://download.pytorch.org/whl/cu117

- Om te controleren of Whisper Nvidia GPU kan gebruiken:
fluister — help | findstr -i pytorch
Je zou (default: cuda) moeten zien in plaats van (default: cpu). Verifiëren Versterkende redenen waarom ChatGPT uw taak voor het schrijven van inhoud niet aanneemt.
Wat te doen als Torch niet kan worden geïnstalleerd
Als je de foutmelding "Geen versie gevonden" tegenkomt tijdens het installeren van Torch, moet je mogelijk een oudere versie van Python parallel aan je huidige versie installeren.
Gebruik hiervoor deze opdracht:
choco install python — version OLDER_VERSION — side-by-side
Vervang "OLDER_VERSION" door een versie zoals 3.10.

Gebruik vervolgens het secundaire versiepad voor alle "globale" Whisper-commando's (bijv. "c:\Python310\Scripts\pip.exein plaats van gewoon "pip").
Hoe u uw stem kunt opnemen
U kunt elke audio-opnametoepassing gebruiken om uw stem naar een WAV- of MP3-bestand te converteren. Windows bevat zo'n app. Zie Hoe deze te gebruiken voor meer informatie Spraakrecorder-app op Windows 10.
Probeer Audacity voor een volledige optie. Leer hoe u dit kunt doen met onze gids op Audacity gebruiken Audio opnemen op Windows en Mac.

Hoe te beginnen met schrijven met Whisper
Hoewel Whisper niet wordt geleverd met een eenvoudige grafische gebruikersinterface, is het gebruik ervan erg soepel.
Laten we zeggen dat we een Grieks spraakbestand LatestNote.mp3 hebben, in de map c:\MyAudioFiles, en we willen het in het Engels vertalen en naar een tekstbestand kopiëren.
- We beginnen te rennen Opdrachtprompt of PowerShell.
- We "veranderen de map" waar het audiobestand is opgeslagen met deze opdracht:
cd C:\MyAudioFiles
- We voeren Whisper in het bestand uit met:
fluisteren — modelbasis — taal gr — taak vertalen LaatsteNotitie.mp3

Na verwerking verschijnt het tekstbestand (met de naam "LatestNote.mp3.txt") in dezelfde map. Open het in een teksteditor zoals Kladblok om de vertaalde tekst te bekijken.
We hebben een voorbeeldvertaling gebruikt omdat de Engelse transcriptie duidelijker is: gebruik gewoon de tags "lose", " –language" en "-task". Voor eenvoudige fonetische transcriptie zou het bovenstaande commando dus zijn:
gefluister — modelbasis LatestNote.mp3
De tag “model” is vereist omdat Whisper een van de verschillende opties gebruikt. Laten we het uitbreiden om u te helpen de beste te kiezen voor uw behoeften. Verifiëren Wat is de voice-overfunctie? Wat is zijn rol en hoe ga je daarin te werk?
Welk model kiezen?
Whisper biedt verschillende taalmodellen aan. Hoe groter het model, hoe hoger de nauwkeurigheid, maar ook hoe hoger de hardwarevereisten. Wat is:
- Klein.
- Baseren.
- Klein.
- Medium.
- Groot.
Tiny- of Base-formulieren zouden prima moeten zijn voor de meeste Engelssprekenden. Niet-moedertaalsprekers van het Engels zien mogelijk betere resultaten met de grotere modellen, zoals de Medium en Large.
Merk echter op dat de Medium en Large modellen meer dan 8 GB VRAM nodig hebben (d.w.z. "het geheugen van je GPU").

Om er een te selecteren, geeft u het model op na de toets " — model" in de opdracht:
fluisteren — model klein/middelgroot/groot [bestand]
Bijvoorbeeld:
fluisteren — klein model My_Voice_Note.mp3
Hoe transcriptie te vereenvoudigen
Als je elke keer dat je wat audio wilt transcriberen het hele Whisper-commando moet typen, kan dat snel vervelend worden. Laten we een wereldwijd toegankelijk batchbestand maken om het proces te vereenvoudigen.
- Start Windows Verkenner en bezoek de schijf C:.
- Maak een map voor scripts en kopieer het pad naar het klembord.
- Zoek en selecteer Pad in het Windows Start-menu Systeemomgevingsvariabelen wijzigen.

- Zoeken Pad wisselaar binnen gebruikersvariabelen voor UW_USERNAME. Dubbelklik erop om het te wijzigen. Klik جديد , en plak het pad naar uw map scripts. Klik op OK om de wijzigingen te accepteren.

- Ga terug naar de map scripts in Windows Verkenner. Maak daar een nieuw batchbestand met de naam "wht.bat". "Daarin", voeg deze opdracht toe:
fluisteren — klein model — taal in %1

- Maak twee batchbestanden, "whs" en "whm".
- Voeg deze opdracht toe aan het eerste bestand:
fluisteren — klein model — taal in %1
- Voeg deze opdracht toe aan het tweede bestand:
fluisteren — modelmedium — taal in %1
Gefeliciteerd, je hebt nu drie bestanden om eenvoudig Whisper Small, Medium en Basic-sjablonen te gebruiken met je audiobestanden! Om elk audiobestand naar tekst te converteren:
- Zoek het bestand met behulp van Windows Verkenner.
- Klik met de rechtermuisknop op een lege ruimte en kies Openen in Terminal.
- Typ deze opdracht en vervang "wht" door "whs" of "whm" om kleine of middelgrote taalvormen te gebruiken:
wht YOUR_AUDIO_FILE.mp3
Schrijf snel audiocontent met Whisper
Zelfs de snelste typisten kunnen de snelheid waarmee wij spreken niet evenaren. Tot voor kort was spreken in plaats van schrijven echter niet optimaal voor het maken van documenten.
De meeste audio-naar-tekst-oplossingen hebben middelmatige resultaten opgeleverd. Je zou een aantal oplossingen kunnen vinden die het proberen waard waren, maar die te ingewikkeld waren om te gebruiken of te duur. Gelukkig heeft Whisper daar verandering in gebracht.
Na de bovenstaande stappen zou u klaar moeten zijn om uw stem in hoge definitie te transcriberen of te vertalen, met slechts één opdracht. U kunt nu bekijken Beste spraak-naar-tekst-apps voor het maken van aantekeningen, vergaderingen en lezingen.










