Майкрософтските изследователи твърдят, че модели с изкуствен интелект все още не могат да решават сложни проблеми.
Microsoft‑изследователите откриха ограниченията на съвременните големи езикови модели (LLM) при изпълнението на сложни многократно задачи
В рамките на експерименти Microsoft Research установиха, че дори най-напредналите ИИ‑модели правят сериозни грешки, когато им се възлага да извършват продължителни и многоетапни операции. Сред тестваните системи — Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4 — средно всяка загуби около 25 % от съдържанието на документите след автономна обработка.
Какво точно се тества
* Бенчмарк DELEGATE‑52
Създаден от екипа Филип Лабан, Тобиас Шнабел и Дженифер Невил. Той моделира работните процеси в 52 професионални области: от програмиране и нотна записка до кристалография.
* Критерий за оценка
Моделите се оценяват по това колко запазват целостта на документа след 20 цикъла обработка. Прагът „готовност“ е бил поставен на 98 % – ако резултатът падне под него, задачата се счита за неуспешна.
Основни изводи
Област | Най-добри резултати | Програмиране | Най-силни показатели | Естествен език | По-малко надеждни модели
---|---|---|---|---|---
* Падане на качеството
В повече от 80 % комбинации от документи качеството падна до 80 % и по-ниско. Най-добрата модел (Gemini 3.1 Pro) удовлетворяваше критериите за готовност само в 11 от 52 области.
* Скокове на грешки
Загубите не се случваха постепенно, а „скачково“: при един цикъл взаимодействие модела може да загуби от 10 до 30 % точност. По-напредналите модели (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) се опитваха да избегнат малки грешки, като ги отлагане на по-късен етап и намаляват броя взаимодействия.
* Управление чрез агент
При използване на инструменти в режим агента резултатите не се подобриха: до края на цикъла качеството падна приблизително с 6 %.
Какво означава това за потребителите
Учениците подчертават, че потребителите все още трябва внимателно да контролират работата на ИИ‑системите при делегиране им на полномощия. Текущите модели могат да функционират автономно само в тесни сфери.
Въпреки това авторите на бенчмарка отбелязват забележим напредък: семейството OpenAI модели подобри производителността си от 14,7 % до 71,5 % за 16 месеца. Това потвърждава, че LLM продължават да се развиват, но все още остават ограничени в сложни многократно задачи.
Коментари (0)
Споделете мнението си — моля, бъдете учтиви и по темата.
Влезте, за да коментирате