Майкрософтските изследователи твърдят, че модели с изкуствен интелект все още не могат да решават сложни проблеми.

Майкрософтските изследователи твърдят, че модели с изкуствен интелект все още не могат да решават сложни проблеми.

24 hardware

Microsoft‑изследователите откриха ограниченията на съвременните големи езикови модели (LLM) при изпълнението на сложни многократно задачи

В рамките на експерименти Microsoft Research установиха, че дори най-напредналите ИИ‑модели правят сериозни грешки, когато им се възлага да извършват продължителни и многоетапни операции. Сред тестваните системи — Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4 — средно всяка загуби около 25 % от съдържанието на документите след автономна обработка.

Какво точно се тества
* Бенчмарк DELEGATE‑52

Създаден от екипа Филип Лабан, Тобиас Шнабел и Дженифер Невил. Той моделира работните процеси в 52 професионални области: от програмиране и нотна записка до кристалография.

* Критерий за оценка

Моделите се оценяват по това колко запазват целостта на документа след 20 цикъла обработка. Прагът „готовност“ е бил поставен на 98 % – ако резултатът падне под него, задачата се счита за неуспешна.

Основни изводи
Област | Най-добри резултати | Програмиране | Най-силни показатели | Естествен език | По-малко надеждни модели
---|---|---|---|---|---
* Падане на качеството

В повече от 80 % комбинации от документи качеството падна до 80 % и по-ниско. Най-добрата модел (Gemini 3.1 Pro) удовлетворяваше критериите за готовност само в 11 от 52 области.

* Скокове на грешки

Загубите не се случваха постепенно, а „скачково“: при един цикъл взаимодействие модела може да загуби от 10 до 30 % точност. По-напредналите модели (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) се опитваха да избегнат малки грешки, като ги отлагане на по-късен етап и намаляват броя взаимодействия.

* Управление чрез агент

При използване на инструменти в режим агента резултатите не се подобриха: до края на цикъла качеството падна приблизително с 6 %.

Какво означава това за потребителите
Учениците подчертават, че потребителите все още трябва внимателно да контролират работата на ИИ‑системите при делегиране им на полномощия. Текущите модели могат да функционират автономно само в тесни сфери.

Въпреки това авторите на бенчмарка отбелязват забележим напредък: семейството OpenAI модели подобри производителността си от 14,7 % до 71,5 % за 16 месеца. Това потвърждава, че LLM продължават да се развиват, но все още остават ограничени в сложни многократно задачи.

Коментари (0)

Споделете мнението си — моля, бъдете учтиви и по темата.

Все още няма коментари. Оставете коментар и споделете мнението си!

За да оставите коментар, моля, влезте в профила си.

Влезте, за да коментирате