Het GPT-4-model van OpenAI is veruit het beste generatieve AI-model dat momenteel op de markt verkrijgbaar is, maar dat betekent niet dat we niet naar de toekomst kijken. Nu Sam Altman, CEO van OpenAI, regelmatig hints geeft over de aanstaande komst van GPT-5, lijkt het waarschijnlijk dat we binnenkort een nieuw, bijgewerkt en geavanceerder model van AI zullen zien.
Tenminste, dat hopen wij. Er is geen vaste releasedatum voor GPT-5, en het meeste van wat we denken te weten komt voort uit het samenvoegen van andere informatie en het proberen de punten met elkaar te verbinden. Verifiëren Redenen om Claude 3 te gaan gebruiken in plaats van ChatGPT.

Ongeacht de leverdatum zijn er echter enkele belangrijke functies die we graag zouden zien wanneer GPT-5 wordt gelanceerd.
Snelle links
Wat is GPT-5 voor OpenAI?
Het GPT-5-model is de toekomstige opvolger van OpenAI's GPT-4 AI-model, waarvan algemeen wordt verwacht dat het het krachtigste generatieve model op de markt zal zijn. Hoewel er momenteel geen officiële releasedatum is voor GPT-5, zijn er aanwijzingen dat deze al in de zomer van 2024 zou kunnen verschijnen. Er zijn op dit moment nog maar heel weinig details bekend over het model, maar er kunnen veel dingen omheen gezegd worden. met vertrouwen. Voor bevestiging:
- OpenAI heeft een handelsmerk voor de naam ingediend bij het Office of... Patenten en handelsmerken In de Verenigde Staten.
- Verschillende leidinggevenden van OpenAI hebben de potentiële mogelijkheden van het model besproken of erop gezinspeeld.
- Sam Altman, CEO van OpenAI, noemde het model herhaaldelijk tijdens een interview op YouTube In maart 2024 met Lex Friedman.
Dit alles wijst op één spannend feit: GPT-5 komt eraan! Veel dingen zijn op dit moment echter slechts speculaties. Maar er zijn enkele functies die we hopen te zien en waarvan we vrij zeker zijn dat we ze in dit model zullen zien. Hier zijn er een aantal:
1. Ondersteuning van meer multimedia

Een van de meest opwindende verbeteringen aan de GPT-familie van AI-modellen is multimodaliteit. Voor de duidelijkheid: multimodaliteit is het vermogen van een AI-model om meer te verwerken dan alleen tekstinvoer, maar ook andere soorten invoer, zoals afbeeldingen, audio en video. Multimodaliteit zal in de toekomst een belangrijke vooruitgangsstandaard zijn voor de GPT-modellenfamilie.
Nu GPT-4 al bedreven is in het verwerken van beeldinvoer en -uitvoer, zijn verbeteringen op het gebied van audio- en videoverwerking de volgende doorbraak voor OpenAI, en GPT-5 is een goed beginpunt. Google boekt met een model al serieuze vooruitgang in dit soort multimedia Tweeling AI Haar eigen. Het zou ongebruikelijk zijn als OpenAI niet zou reageren. Maar geloof ons natuurlijk niet op ons woord. Op zijn podcast Breng mij niet in verwarring [PDF-versie], Bill Gates vroeg aan Sam Altman, CEO van OpenAI, welke belangrijke mijlpalen hij de komende twee jaar verwacht voor de GPT-serie. Zijn eerste antwoord? Het was videoverwerking.
Voor GPT-5 verwachten we dus video's te kunnen verwerken: video's uploaden als prompts, onderweg video's maken, video's bewerken met tekstprompts, clips uit video's extraheren en specifieke scènes uit grote videobestanden vinden. We verwachten soortgelijke dingen te kunnen doen met audiobestanden. Het is een grote vraag, ja. Maar gezien hoe snel AI evolueert, is dit een zeer redelijke verwachting.
2. Groter en efficiënter contextvenster

Ondanks dat het een van de meest geavanceerde AI-modellen op de markt is, heeft de GPT-familie van AI-modellen een van de kleinste contextvensters. Claude 3 van Anthropic heeft bijvoorbeeld een contextvenster met 200.000 tokens, terwijl Gemini van Google maar liefst 1.000.000 tokens aankan (128.000 voor standaardgebruik). GPT-4 heeft daarentegen een relatief kleiner contextvenster van 128.000 tokens, waarbij ongeveer 32.000 of minder tokens realistisch gezien beschikbaar zijn voor gebruik op interfaces zoals ChatGPT.
Nu geavanceerde multimedia op de voorgrond komt, is het verbeteren van het contextvenster bijna onvermijdelijk geworden. Een verhoging met een factor twee of vier zou voldoende kunnen zijn, maar we hopen zoiets als een factor tien te zien. Hierdoor kan GPT-5 meer informatie op een efficiëntere manier verwerken. Een groter contextvenster betekent niet altijd beter. Dus in plaats van alleen maar het contextvenster te vergroten, zouden we graag een toename zien in de efficiëntie van contextverwerking.
U ziet dat een model een contextvenster van 1.000.000 tokens kan hebben (capaciteit van ongeveer 700.000 woorden), maar er niet in slaagt een alomvattende samenvatting te produceren wanneer hem wordt gevraagd een boek van 500.000 woorden samen te vatten, omdat het de hele context niet adequaat kan verwerken, ondanks dat het de mogelijkheid heeft om dit te doen. dit in theorie. Het feit dat u een boek van 500.000 woorden kunt lezen, betekent niet dat u alles erin op een verstandige manier kunt onthouden of verwerken. Verifiëren Waarom het contextvenster van 1.5 miljoen tokens in Gemini XNUMX een gamechanger is.
3. GPT-proxy's

Misschien wel een van de meest opwindende mogelijkheden voor een GPT-5-release is het debuut van GPT-proxy's. Hoewel de term ‘game changer’ waarschijnlijk te veel wordt gebruikt in AI, zal de toevoeging van GPT-agents in elke betekenis van het woord een game changer zijn. Maar hoe groot zal deze potentiële verandering zijn?
Momenteel kunnen AI-modellen zoals GPT-4 u helpen de taak te voltooien. Ze kan een e-mail schrijven, een grap maken, een wiskundeprobleem oplossen of een blogpost voor je schrijven. Het kan echter alleen deze specifieke taak uitvoeren en kan geen reeks gerelateerde taken uitvoeren die nodig kunnen zijn om uw werk te voltooien.
Stel dat u een webontwikkelaar bent. Als onderdeel van je werk wordt er van je verwacht dat je veel dingen doet: ontwerpen, code schrijven, problemen oplossen en nog veel meer. Momenteel kunt u slechts een deel van deze taken tegelijk delegeren aan AI-modellen. Misschien zou je een GPT-4-model kunnen vragen om code te schrijven om de startpagina te configureren, en dat dan te laten doen voor de contactpagina, dan voor de over-pagina, enzovoort. U zult deze taken regelmatig moeten uitvoeren. Er zijn taken die modellen niet kunnen voltooien.
Dit iteratieve proces van het motiveren van AI-modellen om specifieke deeltaken uit te voeren is tijdrovend en inefficiënt. In dit scenario ben jij – de webontwikkelaar – de menselijke agent die verantwoordelijk is voor het coördineren en motiveren van het AI-model met één taak tegelijk totdat het een volledige reeks gerelateerde taken voltooit.
GPT-agenten beloven gespecialiseerde robots die worden gecoördineerd door GPT-5 en hopelijk in staat zijn om zelfsturend te zijn en alle subsets van een complexe taak autonoom af te handelen. Focus op ‘zelfmotivatie’ en ‘autonomie’.
Dus als GPT-5 wordt geleverd met GPT-agents, kunt u het programma vragen ‘een website te bouwen voor het portfolio van Maxwell Timothy’ in plaats van alleen maar ‘code te schrijven voor de startpagina’. GPT-5 zou dan theoretisch in staat zijn om autonome prompts te initiëren door een beroep te doen op deskundige AI-agenten om de verschillende subtaken uit te voeren die nodig zijn om een website te maken. Er kan een GPT worden opgeroepen om op internet te zoeken naar informatie over Maxwell Timothy, een andere agent om code voor verschillende pagina's te schrijven, een andere agent om afbeeldingen te maken en te verbeteren, en zelfs een andere AI-agent om de website te publiceren, allemaal zonder dat daarvoor frequente menselijke tussenkomst nodig is. aanwijzingen. Verifiëren Is het de moeite waard om Auto-GPT te gebruiken zonder GPT-4?
4. Minder hallucinaties
Hoewel OpenAI een lange weg heeft afgelegd in het omgaan met hallucinaties in zijn AI-modellen, zal de echte test van GPT-5 het vermogen zijn om het aanhoudende probleem van hallucinaties aan te pakken, dat de wijdverbreide adoptie van AI heeft belemmerd vanwege de hoge risico’s die eraan verbonden zijn. , vooral in... Veiligheid die van cruciaal belang is, zoals de gezondheidszorg, de luchtvaart en cyberbeveiliging. Dit zijn allemaal gebieden die enorm zouden profiteren van intensieve AI-betrokkenheid, maar die momenteel elke significante adoptie vermijden.
# Over het "hallucinatieprobleem"
Ik heb er altijd een beetje moeite mee als mij wordt gevraagd naar het 'hallucinatieprobleem' bij LLM's. Omdat hallucinatie in zekere zin het enige is wat LLM's doen. Het zijn droommachines.
We sturen hun dromen met aanwijzingen. De aanwijzingen starten de droom, en gebaseerd op de...
- Andrej Karpathy (@karpathy) December 9, 2023
Voor de duidelijkheid: hallucinaties verwijzen in deze context naar situaties waarin een AI-model informatie creëert en presenteert die plausibel lijkt, maar volledig met een hoge mate van vertrouwen is verzonnen. Verifiëren Methoden voor het voorkomen van hallucinaties in modellen van kunstmatige intelligentie.
Stel je een scenario voor waarin GPT-4 wordt geïntegreerd in een diagnostisch systeem om de symptomen van patiënten en medische rapporten te analyseren. Hallucinaties kunnen ertoe leiden dat AI vol vertrouwen een onjuiste diagnose stelt of een potentieel gevaarlijke behandeling aanbeveelt op basis van ingebeelde feiten en valse logica. De gevolgen van een dergelijke fout op medisch gebied kunnen catastrofaal zijn.
Soortgelijke voorbehouden gelden voor andere gebieden die grote zorgen baren, zoals de luchtvaart, kernenergie, maritieme operaties en cyberveiligheid. We verwachten niet dat GPT-5 het hallucinatieprobleem volledig zal oplossen, maar we verwachten wel dat het de kans op dergelijke incidenten aanzienlijk zal verkleinen.
Terwijl we reikhalzend uitkijken naar de officiële release van dit langverwachte AI-model, is één ding zeker: GPT-5 heeft het potentieel om de grenzen te herdefiniëren van wat mogelijk is met AI, en luidt daarmee een nieuw tijdperk van mens-machine-samenwerking en innovatie in. Je kunt nu bekijken De beste slimme claimgeneratoren voor elk AI-aangedreven formulier.










