Американският стартъп Tavus представи AI модела Griffin за видеокомуникация в реално време. В експеримента на компанията 26 от 54 участници (48%) след едноминутен разговор сбъркаха виртуалния събеседник Griffin-Lite с истински човек. Разработчикът определи резултата като първото успешно преминаване на теста на Тюринг във формат на видеокомуникация.

Въпреки това участниците бяха предварително уведомени, че ще разговарят с друг човек. Ето защо експериментът показва убедителността на аватара в кратък разговор, но не доказва, че системата ще издържи целенасочена проверка. При предишната AI система на Tavus при сходни условия само един от 41-те участници (2,4%) я е сметнал за човек.

AI моделът Griffin има принципно нова архитектура. Преди компанията е използвала последователен подход: първо се разпознава речта, след това текстът се предава на езиковия модел за генериране на отговор, след което резултатът се извежда чрез система за синтез на реч, която управлява цифровия аватар. Тоест системата трябваше да изчака потребителят да приключи с говоренето, преди самата тя да може да започне да отговаря.

Архитектурата на Griffin беше описана от Tavus като „пълнодуплексна система видео-във-видео“. Тя включва само два компонента: механизъм за моделиране на непрекъснат диалог, който постоянно следи аудио и видеосигналите на потребителя и в реално време решава кога и как да отговори, както и механизъм за аудиовизуално генериране, който синхронно преобразува тези сигнали в звук и видео. Оценката на състоянието на диалога се извършва на интервали от по-малко от секунда. Когато потребителят говори, Griffin може да кима с глава, да вмъква реплики, да променя изражението на лицето си и дори да започне да отговаря – паузата в речта не се възприема задължително като сигнал, че човекът е приключил с говоренето.

Griffin се причислява към класа „модели за взаимодействие с човека“ (Human Interaction Model – HIM), тоест човекът не управлява компютъра, а работи с него. Griffin-Lite генерира видео с резолюция 720p на фрагменти от по 320 милисекунди и може да клонира глас въз основа на десетсекундна записи. В сравнение с четири генератора на видео моделът е начело по показателите DOVER, FID и THEval. Средното закъснение при преобразуването на постъпващия звук във видео е 0,43 секунди на Nvidia H100 – това не е времето за реакция на цялата система.

Introducing Griffin, the first model to pass the video Turing test.

48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video.

It’s the first Human Interaction Model (HIM). pic.twitter.com/eb11XbC8Xr

— Tavus (@tavus) October 1, 2026

Nvidia проведе отделна оценка в бенчмарка VideoFDB. Griffin-Lite получи 3,83 точки за генериране на аудиовизуално поведение при човешки еталон от 3,92. В категорията „възприятие“ резултатът беше 3,73 точки спрямо 4,20 за човека и 3,44 за най-близкия конкурент. Оценките се поставят от езиковия модел по петстепенна скала въз основа на зададени критерии. Tе характеризират отделни аспекти на общуването, а не общата равностойност спрямо човека.

Забележително е, че участниците в тестването не просто смятаха, че Griffin просто изглежда като човек – повече от половината заявиха, че по време на разговора дори не им е хрумнало, че събеседникът може да не е истински човек. Тези, у които възникваха подозрения обикновено започваха да се съмняват през първите 20 секунди от разговора.

Griffin-Lite е достъпен за ограничен кръг от тестери. Преди по-широкото му пускане на пазара Tavus възнамерява да усъвършенства мерките за сигурност, включително уведомяването на събеседника за взаимодействието с AI. Компанията предлага системата да се използва за обучение, репетиции на сложни разговори и дистанционна помощ за потребителите.