ChatGPT versteht jetzt auch Bilder und Sprachbefehle
Der ChatGPT-Chatbot wird von OpenAI ständig verbessert. Mit der neuen Version können Benutzer ChatGPT auch mit Sprache und Bildern aktivieren, was neue Fragen und Bedenken aufwirft. Was bringt die neue Version und wann?
Večina sprememb, ki jih OpenAI uvaja v ChatGPT, se nanaša na to, kaj bot, ki ga poganja umetna inteligenca, zmore: na kakšna vprašanja lahko odgovarja, do katerih informacij lahko dostopa in podobno. Tokrat pa spreminja tudi način, kako lahko sami uporabljate ChatGPT. Podjetje uvaja novo različico storitve, ki vam omogoča, da z umetno inteligentnim AI botom komunicirate ne samo s pisanjem stavkov v besedilno polje, temveč tudi tako, da z njim govorite ali pa samo naložite sliko. Nove funkcije bodo tistim, ki plačujejo naročnino Plus, na voljo v naslednjih tednih, ostali pa bodo nove funkcionalnosti prejeli “kmalu zatem”.
Del z glasovnimi ukazi ni nič pretresljivo novega: tapnete gumb in izgovorite svoje vprašanje, ChatGPT ga pretvori v besedilo in ga posreduje velikemu jezikovnemu modelu, pridobi odgovor in ga pretvori nazaj v govor ter vam odgovori glasovno. To bi moralo spominjati na pogovor z Alexo ali Googlovim asistentom, le da – tako upa OpenAI – bodo odgovori boljši zaradi izboljšane osnovne tehnologije. Zdi se, da se večina virtualnih pomočnikov prenavlja in vključuje velike jezikovne modele – OpenAI pa je za zdaj korak pred vsemi.
Odličen OpenAI-jev model Whisper opravlja velik del pretvorbe govora v besedilo, podjetje pa uvaja tudi nov model pretvorbe besedila v govor, ki naj bi znal ustvariti “zvok, podoben človeškemu, in to samo iz besedila in nekaj sekund vzorčnega govora.” Izmed petih možnosti boste lahko izbrali glas za ChatGPT, vendar se zdi, da OpenAI meni, da ima model veliko večji potencial. OpenAI na primer sodeluje s Spotifyjem pri prevajanju podkastov v druge jezike, pri čemer ohranja zvok glasu osebe, ki vodi podkast. Obstaja veliko zanimivih načinov uporabe sintetičnih glasov in OpenAI bi lahko bil velik del te industrije.
Ne glede na vse pa dejstvo, da lahko ustvarite spodoben sintetični glas samo z nekaj sekundami zvočnega posnetka, odpira vrata za vse vrste potencialno problematičnih primerov uporabe. “Te zmogljivosti predstavljajo nove nevarnosti, kot je možnost, da bi zlonamerni akterji posnemali javne osebnosti in podobno,” je zapisano v blogu podjetja, ki napoveduje nove funkcije. Model ravno zaradi tega ni na voljo za širšo uporabo in bo veliko bolj nadzorovan in omejen na določene primere uporabe ter partnerstva.
Die Bildsuchfunktion ähnelt in gewisser Weise der von Google Lens. Sie machen ein Foto und ChatGPT versucht zu verstehen, was Sie fragen, und reagiert entsprechend. Sie können auch das Zeichentool in der App verwenden, um die Frage so klar wie möglich zu formulieren, oder Fragen zum Bild sprechen oder eingeben. Hier kommt die Natur von ChatGPT besonders zum Tragen: Anstatt eine Suche durchzuführen, die falsche Antwort zu erhalten und dann eine neue Suche durchzuführen, können Sie den Bot anstoßen und die Antwort während des Vorgangs verfeinern. Dies ist sehr ähnlich zu dem, was Google mit der multimodalen Suche macht.
Očitno ima vključitev slik v ChatGPT tudi svoje slabosti. Ena od njih je, ko uporabite ChatGPT “na osebi”: OpenAI pravi, da je zavestno omejil “sposobnost ChatGPT-ja, da analizira in daje neposredne izjave o ljudeh”. Tako zaradi natančnosti, kot tudi zaradi zasebnosti. To pomeni, da ena najbolj znanstvenofantastičnih predstav o umetni inteligenci – sposobnost, da nekoga pogleda in pove, kdo je – ne bo kmalu uresničena. Kar je verjetno dobra stvar.
Fast ein Jahr nach der Blütezeit von ChatGPT versucht OpenAI offenbar immer noch herauszufinden, wie es seinem Modell mehr Funktionen und Fähigkeiten verleihen kann, ohne neue Probleme und Nachteile zu schaffen. Bei Neuveröffentlichungen hat das Unternehmen versucht, diesen schmalen Grat zu beschreiten, indem es die Möglichkeiten seiner neuen Modelle bewusst einschränkte. Tatsache ist jedoch, dass dieser Ansatz nicht immer funktionieren wird. Da immer mehr Menschen Sprachsteuerung und Bildsuche nutzen und ChatGPT immer mehr zu einem wirklich multimodalen, nützlichen virtuellen Assistenten wird, wird es immer schwieriger, alle diese Schutzmaßnahmen einzuhalten.