Claude Mythos е потвърдена от тестване като лидер в откриването на уязвимости, но той показва и други недостатъци
Кратко съдържание
Компанията XBOW проведе независима оценка на ИИ-модела Mythos Preview от Anthropic. Резултатите показаха, че моделът превъзходи съществуващите аналози при търсене на уязвимости в изходния код и при работа с нативен код и реверсивно инженеринг, но проявява слабости при анализ на изолирани кода и потвърждаване на практическата приложимост на открити експлойти. Цената на работата на модела остава въпрос: Mythos е по-скъпо от Opus, но при ограничен бюджет токени той понякога демонстрира по-добра точност.
1. Какво проверява XBOW
- Обем тестове – серия независими експерименти върху Mythos Preview.
- Сценарии – одит на работещи системи с достъп до изходния код, анализ на изолирани кода, реверсивно инженеринг и взаимодействие с графичен интерфейс.
2. Ключови заключения
Показател Mythos Preview Противоположни модели
Обнаружение уязвимостей – Най-добър показател сред всички модели, особено в изходния код и нативно програмиране. По-малко точен, но понякога по-надежден при проверка на конкретни случаи.
Отсев на лъжливите сигнали – Премахва повече „лъжи“ отколкото предшествениците. Често издава повече фалшиви тревоги.
Проблеми в изолирания код – Моделът се справя по-слабо без контекст на системата. Някои модели работят по-добре с постръчен анализ.
Подтверждение на експлойти – Склонен към буквален подход, понякога преоценява практическата стойност на откритията. По-скоро критичен към реалната приложимост.
Реверсивно инженеринг и нативен код – Издава силни резултати; добре „разбира“ логиката на програмата без изходен код. По-малка точност в тези задачи.
Взаимодействие с UI – Не винаги точно намира координатите на елементите, но успешно определя нужните действия в браузъра. Някои модели са по-точни при позициониране.
3. Цена и ефективност
- Ценообразуване – Anthropic заяви, че Mythos ще струва пет пъти повече от Opus.
- Икономически анализ – XBOW провежда експерименти с „дешеви“ модели, предоставяйки им повече време за работа. Резултатите показаха, че при нормализиране по цена работата на Mythos Preview не изглежда разходна за задачи със висока точност.
- Бенчмаркове – При фиксиран бюджет токени Mythos превъзхожда Opus 4.6 в търсене на уеб уязвимости, но уступва GPT5.5.
4. Итог
Mythos Preview демонстрира изключителна мощ при одит на изходен код и нативни програми, както и при задачи по реверсивно инженеринг и анализ на уеб приложения. Въпреки това моделът понякога недооценява реалната приложимост на открити уязвимости и проявява слабости в изолирания анализ на кода. При ограничени ресурси токени Mythos може да бъде по-изгоден от Opus, но при пълен бюджет GPT5.5 остава конкурент.
Извод XBOW: Mythos Preview – надежден инструмент за откриване на потенциални уязвимости в изходния код и сложни системи, но изисква допълнително потвърждение на практическата стойност на откритите експлойти.
Коментари (0)
Споделете мнението си — моля, бъдете учтиви и по темата.
Влезте, за да коментирате