Напредъкът на ИИ се забавя поради прекомерно количество безполезни данни – има твърде много.
Ключовото заключение: за да преминем от ChatGPT към „живи“ роботи, не са нужни само големи набори данни, а качествени и релевантни сведения.
Fortune подчертава, че индустрията на ИИ стои на прага на нова ера – физически интелект и модели на околната среда. Тези системи трябва да се ориентират в реалното пространство: да се движат по пътя, да сглобяват бельо или да помагат при сложни хирургични интервенции. За това им трябват не просто „изтегляеми“ данни, а богати, многопластови набори от информация.
Защо качеството на данните е критично
1. Излишък и безполезност
В условията на ажитация около ИИ се появиха множество стартапове (Scale AI, Surge AI, Mercor), които се стремят да съберат колкото се може повече данни. Това води до натрупване на огромен обем „празни“ файлове, които не допринасят за обучението на моделите. Ако изследователите не успеят да ги филтрират, потенциалът на физическия ИИ ще остане недоизползван.
2. Сложност на многомерните задачи
Разбирането на сложния свят изисква още по-големи обеми данни, но те са изключително труднодостъпни. Затова инженерите прибягват към моделиране: създават виртуални реконструкции на реални сценарии, за да генерират обучителни примери за роботи и автономни транспортни средства.
3. Рискове от нискокачествени набори
Нека качествените данни могат да доведат до непредсказуеми резултати. Пример е прекратяването на поддръжката на видеоприложението Sora от OpenAI: моделът не се справяше с физиката, което пречеше на реалистичните прогнози.
Как да решим проблема
- Инструменти за почистване
Специалистите по машинно обучение имат нужда от технологии, които автоматично изтриват излишни данни, анализират, нормализират и коригират наборите. Това ще позволи извличането на ценна информация от „шум“.
- Фокус върху качеството
В момента ограничителният фактор е недостигът на качествени данни. Компаниите, които първо разпознаят това и започнат да инвестират в събирането и обработката им, ще станат лидери в създаването на действително работещи ИИ‑системи.
Следователно, преходът от текстови модели към роботи, способни да действат в реалния свят, е невъзможен без системен подход към качеството на обучителните данни. Fortune подчертава, че именно този фактор ще бъде решаващ за бъдещия физически интелект.
Коментари (0)
Споделете мнението си — моля, бъдете учтиви и по темата.
Влезте, за да коментирате