Значок веб-сайту Xpert.Digital

Кінець дорогому ШІ? Ціновий шок на OpenAI: Чому GPT-6 Sol та Luna перевертають ринок ШІ з ніг на голову

Кінець дорогому ШІ? Ціновий шок на OpenAI: Чому GPT-6 Sol та Luna перевертають ринок ШІ з ніг на голову

Кінець дорогому ШІ? Ціновий шок на OpenAI: Чому GPT-6 Sol та Luna перевертають ринок ШІ з ніг на голову – Креативне зображення на тему, зі ШІ: Xpert.Digital

Більше продуктивності, вдвічі дешевше: як новий дует GPT-6 від OpenAI тисне на конкурентів

Атака на Anthropic: OpenAI руйнує існуючу логіку ціноутворення за допомогою GPT-6 Sol & Luna

Інтелект за вигідною ціною: як GPT-6 змінює економіку штучного інтелекту

З несподіваним запуском своїх нових моделей GPT-6 Sol та GPT-6 Luna, OpenAI започатковує нову еру в конкуренції на ринку штучного інтелекту. Замість того, щоб просто демонструвати нову продуктивність найвищого рівня, компанія атакує своїх конкурентів, зокрема Anthropic, там, де це найважливіше для мас: ціна. Різко скоротивши витрати на використання вдвічі порівняно з попереднім поколінням, ШІ нарешті перетворюється з дорогого предмета розкоші на повсюдну інфраструктуру. Однак ці нові, надзвичайно доступні моделі ціноутворення також створюють стратегічну пастку: хоча автоматизація раптово коштує лише частку своєї колишньої ціни, відкриваючи величезні можливості для бізнес-процесів, вона також загрожує швидким зростанням загального споживання через нові варіанти використання. Ті, хто хоче вийти переможцями в цій новій економіці ШІ, не можуть сліпо покладатися на найнижчу ціну токена, а повинні знати, як вміло організувати моделі в майбутньому.

Цінова атака OpenAI: GPT-6 Sol та Luna змінюють економіку ШІ

Дешевший інтелект стане проблемою для всіх, хто досі отримує прибуток від дефіциту

OpenAI запускає дві нові моделі, GPT-6 Sol та GPT-6 Luna, менш ніж через три місяці після загального випуску сімейства GPT-5.6, які покликані відзначити наступний етап на масовому ринку штучного інтелекту. Центральне повідомлення є щонайменше таким же важливим з економічної точки зору, як і з технологічної: підвищення продуктивності повинно відбуватися не за вищою ціною, а зі значно нижчими витратами на використання. GPT-6 Sol коштує два долари США за мільйон вхідних токенів та десять доларів США за мільйон вихідних токенів через API. Для GPT-6 Luna ціни становлять десять центів за вхідні дані та 50 центів за вихідні. Порівняно з останніми акційними цінами на відповідні моделі GPT-5.6, OpenAI таким чином приблизно вдвічі знижує ціни, при цьому зниження для вихідних токенів Luna становить навіть трохи більше 58 відсотків.

Цей ціновий рух — це більше, ніж просто типове оновлення продукту. Він демонструє, що конкуренція між основними постачальниками штучного інтелекту все більше зміщується від простої гонитви за продуктивністю найвищого рівня до другого рівня: вирішальним фактором є те, скільки економічно вигідної продуктивності генерує модель за певну суму грошей. Саме тут з'являються Sol та Luna. Sol розроблена для виконання вимогливої ​​роботи з знаннями, розробки програмного забезпечення та агентних процесів за витратами, які раніше асоціювалися з моделями середнього класу. Luna, з іншого боку, прагне виконувати рутинні завдання настільки економічно ефективно, що ШІ можна буде розгортати в бізнес-процесах, де автоматизація раніше навряд чи була вигідною.

Отже, провокаційна інтерпретація полягає в тому, що OpenAI не просто продає кращі моделі за нижчими цінами, а радше намагається порушити існуючу логіку ціноутворення на ринку. Якщо висока якість моделей більше не обов'язково тягне за собою високі змінні витрати, преміальні ціни втрачають частину свого виправдання. Водночас зростає тиск на конкурентів, щоб вони або пропонували свої моделі за нижчими цінами, або набагато чіткіше демонстрували їхню додану цінність. Для компаній цей розвиток відкриває нові можливості застосування. Однак він також несе ризик того, що падіння собівартості одиниці продукції призведе до неконтрольованого розширення використання, що зрештою призведе до зростання загальних витрат.

Дві моделі для різного створення цінності

Назви Sol та Luna відображають функціональний поділ портфоліо моделей. GPT-6 Sol — це високопродуктивна основна модель, розташована нижче топової моделі GPT-6 Astra. Вона розроблена для завдань, де точність, багаторівневе мислення, надійне використання інструментів та здатність обробляти триваліші робочі процеси є економічно важливими. До них належать складний аналіз, вимогливі завдання програмування, автоматизовані дослідження, керування цифровими додатками та підтримка професійної роботи зі знаннями. GPT-6 Luna, з іншого боку, позиціонується як особливо економічно ефективна та швидка модель для завдань великого обсягу. Вона особливо підходить для класифікації, вилучення, узагальнення, простих завдань кодування, попередніх перевірок та стандартизованого зв'язку.

Такий багаторівневий підхід відображає дедалі важливіше усвідомлення: компаніям не потрібна найпотужніша доступна модель для кожного запиту. Значна частина використання бізнес-штучного інтелекту складається з повторюваних завдань з обмеженою складністю. У цих випадках дуже недорога модель може забезпечити найбільшу економічну вигоду. Лише складні, неоднозначні або високоризикові випадки потрібно передавати потужнішій моделі. Таким чином, Сол і Луна підтримують архітектуру, в якій запити динамічно розподіляються на основі складності, ризику та цінності.

Для OpenAI така сегментація має стратегічний сенс. Дорога флагманська модель Astra може продовжувати служити технологічним еталоном, не перешкоджаючи своїй високій вартості широкому впровадженню. Sol займає ринок високопродуктивних виробничих систем, тоді як Luna охоплює чутливий до ціни масовий ринок. Таким чином, OpenAI може одночасно захищати високу маржу в преміум-сегменті, кидати виклик конкурентам у середньому ціновому сегменті та створювати величезні обсяги використання в низькому ціновому сегменті.

Однак, з точки зору клієнта, це створює нову проблему закупівель. Вибір моделі не повинен ґрунтуватися виключно на прейскурантній ціні. Вирішальними факторами є рівень якості, достатній для конкретного процесу, як часто модель допускає помилки, наскільки дорого їх виявляти та зусилля, необхідні для людського контролю. Модель, яка здається недорогою, може стати дорогою, якщо її результати часто потребують переробки. І навпаки, більш надійна модель може бути економічнішою, якщо вона надійно досягає бажаного результату з меншою кількістю ітерацій та меншим контролем.

Зменшення цін вдвічі змінює розрахунок

Падіння ціни особливо легко зрозуміти у випадку з Sol. GPT-5.6 Sol нещодавно коштував чотири долари США за мільйон вхідних токенів та 20 доларів США за мільйон вихідних токенів у рамках обмеженої за часом акції. GPT-6 Sol зменшує обидві вартості вдвічі до двох та десяти доларів США відповідно. У випадку з Luna вхідна ціна падає з 20 до десяти центів. Вихідна ціна падає з 1,20 долара США до 50 центів. Таким чином, загальне твердження про те, що обидві моделі рівно на 50 відсотків дешевші, надмірно спрощує фактичну структуру: вихідна ціна Luna падає суттєвіше, що особливо актуально для текстових програм.

Вихідні токени представляють собою більший фактор вартості в багатьох застосунках. Система може отримувати відносно коротку інструкцію, але генерувати довгі звіти, фрагменти коду або структуровані набори даних. Саме в таких випадках значне зниження вихідної ціни Luna має помітний вплив. З одним мільйоном вхідних та одним мільйоном вихідних токенів Luna коштує загалом 60 центів. Sol, за тих самих спрощених припущень, коштує дванадцять доларів США. Це являє собою різницю між двома моделями в двадцять разів. Ця різниця чітко ілюструє, чому інтелектуальний вибір моделі стає важливішим, ніж просто прихильність до однієї моделі.

Для компанії з 500 мільйонами вхідних та 100 мільйонами вихідних токенів на місяць, Sol коштуватиме близько 2000 доларів на місяць за стандартною ціною. Luna коштуватиме приблизно 100 доларів. Цей розрахунок моделі не включає інструменти, доступ до пошуку, сховище даних, векторні бази даних, аудити безпеки чи витрати на розробку. Тим не менш, він ілюструє масштаб: при великих обсягах правильне призначення моделі може суттєво вплинути на результат. Ефект ще більший, коли періодична контекстна інформація зчитується з кешу, що призводить до витрат лише на частину звичайної вартості вхідних даних.

Нові ціни одночасно встановлюють новий орієнтир для ринку. Claude Opus 5 пропонувався за 5 доларів за вхідні дані та 25 доларів за вихідні дані, тоді як Claude Fable 5.1 коштував 10 та 50 доларів відповідно. Sol значно дешевше за ці прейскурантні ціни, а Luna знаходиться в зовсім іншому ціновому діапазоні. Простого порівняння токенів недостатньо, оскільки моделі вимагають різної кількості токенів та етапів обробки. Тим не менш, постачальникам стане важче стягувати ціну, яка в кілька разів перевищує ціну OpenAI, якщо вони не зможуть продемонструвати відповідно більшу перевагу в реальних застосуваннях.

Точність цінніша за низьку ціну токена

У своїй заяві OpenAI наголошує на підвищенні фактичної точності. Згідно з внутрішнім аудитом, GPT-6 Sol припустився приблизно вдвічі менше фактичних помилок, ніж його попередник. Хоча це твердження є економічно значущим, його не слід зводити до твердження, що загальний рівень помилок знизився з 20 до 10 відсотків. OpenAI не публікує таких абсолютних цифр для цього порівняння. Аудит проводився з використанням анонімних реальних розмов, у яких користувачі раніше повідомляли про фактичну помилку. Тому це навмисно схильні до помилок випадки, а не репрезентативна вибірка всієї бази користувачів.

Фраза «вдвічі менше помилок» стосується відносного покращення в рамках цього конкретного тесту. Це не означає, що Sol тепер вдвічі надійніший у кожній області. Рівень помилок значною мірою залежить від предмета дослідження, його актуальності, доступу до даних, мови, визначення завдання та дозволених інструментів. Модель може бути дуже надійною з широким спектром загальних знань і одночасно не давати результатів з рідкісною галузевою інформацією, поточними подіями або точними цифрами. Тому компанії повинні сприймати заяву виробника як показник прогресу, а не як гарантію.

Тим не менш, навіть відносне скорочення кількості помилок вдвічі має значний економічний потенціал. У багатьох виробничих процесах найбільші витрати виникають не через запити до моделі, а через ризики моніторингу, виправлення та відповідальності. Якщо система видає проблемний результат лише в одній з десяти відповідей, а не в кожній п'ятій, зусилля на тестування не зменшуються автоматично вдвічі. Повна перевірка все ще може бути необхідною. Однак у менш критичних процесах підвищена надійність може дозволити перехід від суто допоміжного використання до значною мірою автоматизованої обробки.

Особливої ​​уваги заслуговує твердження OpenAI про те, що за високих обчислювальних ресурсів GPT-6 Luna може досягти рівня GPT-5.6 Sol у цій перевірці фактичної точності приблизно за сотий від вартості. Це твердження стосується перевіреної фактичної точності та не повинно екстраполюватися на загальну продуктивність моделі. Luna не буде автоматично працювати так само добре, як її попередник Sol, у кожному аналізі, кожному кодовому проекті чи кожному агентному робочому процесі. Тим не менш, порівняння демонструє, як швидко можливості дорогих моделей вищого рівня мігрують до більш доступних.

Професійна робота перетворюється на конкуренцію між ціною та якістю

У тесті AutomationBench GPT-6 Sol, працюючи з дуже високою обчислювальною інтенсивністю, досягає балу 33,2 відсотка. Claude Opus 5, на максимальних налаштуваннях, досягає 26,9 відсотка. Різниця становить 6,3 відсоткових пункти, а не 6,3 відсотка. Відносно кажучи, Sol приблизно на 23 відсотки вищий за бал Claude. Водночас OpenAI оцінює вартість Sol у 27 центів за завдання, тоді як Opus 5 коштував у цьому тесті в 11,1 раза дорожче. Таким чином, Sol досягає вищого балу в тесті, складаючи лише близько дев'яти відсотків від вартості порівняння.

Бенчмарк відображає повні робочі процеси з використанням 47 інструментів у сферах продажів, маркетингу, операцій, обслуговування клієнтів, фінансів та управління персоналом. Це має більше значення для бізнес-застосунків, ніж суто знаннями засновані питання, оскільки продуктивний агент повинен не лише генерувати текст, але й керувати системами, обробляти проміжні результати та правильно пов'язувати кілька кроків. Водночас абсолютний бал у 33,2 відсотка залишається тривожним. Навіть найкращий результат означає, що значна частина завдань не виконана повністю. Прогрес реальний, але універсально надійна цифрова робоча сила все ще далека від реальності.

GPT-6 Luna покращується на 5,4 відсоткових пункти порівняно зі своїм попередником при високій обчислювальній інтенсивності, тоді як вартість завдання, як кажуть, зменшується на 58 відсотків. Тут також важлива лінгвістична точність. Відсоткові пункти описують абсолютну різницю між двома значеннями продуктивності. З іншого боку, збільшення на 5,4 відсотка було б відносною зміною. Ця різниця може бути значною при оцінці моделі, особливо якщо початкові значення низькі.

Інший тест, «Останній іспит агентів», оцінює довгострокові та економічно значущі завдання з 55 підгалузей. GPT-6 Sol досягає 56,4 відсотка при максимальній обчислювальній інтенсивності, перевершуючи, за даними OpenAI, найкращий результат Claude Opus 5, використовуючи при цьому на 60 відсотків менше витрат на завдання. Це підкреслює напрямок, але й обмеження розвитку. Оцінка успіху трохи вище половини є цінною для контрольованої допомоги, але часто недостатньою для неконтрольованих основних процесів.

Програмування залишається найжорсткішою конкурентною галуззю

У розробці програмного забезпечення різниця між найпродуктивнішими моделями менша. У тесті DeepSWE GPT-6 Sol досягає ефективності 68,8 відсотка при максимальній обчислювальній інтенсивності. Claude Fable 5 досягає 69,9 відсотка при дуже високих налаштуваннях. Таким чином, Sol відстає на 1,1 відсоткового пункту, але, як кажуть, виконує завдання приблизно на 80 відсотків з меншими витратами. GPT-6 Luna досягає 66,6 відсотка, що ставить її близькою до Claude Opus 5 та Claude Fable 5 при середній обчислювальній інтенсивності. За даними OpenAI, Luna витрачає на одне завдання на 93 відсотки менше, ніж Opus 5, і на 96 відсотків менше, ніж Fable 5.

Для компаній цей сценарій є більш економічно привабливим, ніж перемога в тестуванні з невеликою перевагою. Модель, яка забезпечує майже такий самий рівень успіху за частку вартості, може фінансувати більше спроб, додаткові тести та автоматизовані перехресні перевірки. Замість того, щоб платити за одну дорогу ітерацію, система може генерувати кілька економічно ефективних рішень, проводити тести та вибирати лише найкращого кандидата. Таким чином, нижчі витрати на одиницю продукції можуть опосередковано покращити якість усього процесу розробки.

Однак цей ефект не слід переоцінювати. Повторні спроби корисні лише за умови виявлення помилок. З програмним забезпеченням це частково можливо, оскільки компіляція, автоматизовані тести та статичний аналіз забезпечують об'єктивний зворотний зв'язок. Оцінювання складніше через архітектурні рішення, проблеми безпеки або неповні вимоги. Більша кількість згенерованого коду також може означати більший технічний борг та додаткові зусилля на тестування.

OpenAI також посилається на FrontierCode – тест, який оцінює не лише функціональну коректність, але й фактичну інтегрованість змін. Це включає якість тестування, обмежений обсяг змін, стиль програмування та дотримання правил, специфічних для проекту. Ці критерії є вирішальними на практиці. Пропозиція коду може бути формально правильною, але все ще бути непридатною, оскільки вона без потреби модифікує великі частини системи або ігнорує операційні стандарти. Економічна цінність моделі програмування, таким чином, полягає не в обсязі згенерованого коду, а в кількості надійно інтегрованих змін за годину вкладеної роботи.

Комп'ютерне керування стає дешевшим, але не безризиковим

Під час роботи з графічними програмами GPT-6 Sol досягає ефективності 60,5% в офлайн-частині OSWorld 2.0 з дуже високою обчислювальною інтенсивністю. Claude Opus 5 досягає ефективності 60,3% на середніх налаштуваннях. OpenAI оцінює вартість Sol на завдання приблизно на 80% меншою. Очікується, що Luna на максимальних налаштуваннях перевершить середню ефективність GPT-5.6 Sol, коштуючи лише одну десяту від своєї ціни.

Цей розвиток має важливе значення для автоматизації офісу, обслуговування клієнтів та процесів бек-офісу. Багато компаній досі використовують старіші програми без сучасних інтерфейсів програмування. Модель, яка розуміє вміст екрана, керує кнопками та передає інформацію між системами, може подолати ці прогалини. Це створює форму програмної автоматизації, яка є більш гнучкою, ніж традиційні роботи на основі правил.

Однак навіть значення близько 60 відсотків показує, що автоматичне керування комп’ютером залишається ризикованим. У тривалих робочих процесах достатньо одного неправильного кліку, щоб призвести до збою всього процесу. Платежі, права доступу, видалення даних та зміни у виробничих системах є особливо важливими. Тому багаторівневі дозволи, обмежені обсяги дій, ведення журналу та схвалення людиною у точках високого ризику є економічно обґрунтованими.

Реальний прогрес менше полягає в тому, що Sol вже повністю замінила одного працівника. Що ще важливіше, витрати на експериментальну автоматизацію зменшуються. Компанії можуть тестувати більше процесів, не впроваджуючи кожну ідею через дорогий інтеграційний проект. Стандартизовані агенти можуть виходити з успішних пілотних проектів; невідповідні випадки можна відкинути на ранній стадії. Таким чином, зниження ціни скорочує криву навчання для компаній-користувачів.

 

Новий вимір цифрової трансформації з «керованим ШІ» (штучним інтелектом) – платформа та рішення B2B | Xpert Consulting

Новий вимір цифрової трансформації з «керованим ШІ» (штучним інтелектом) – платформа та рішення B2B | Xpert Consulting - Зображення: Xpert.Digital

Тут ви дізнаєтеся, як ваша компанія може швидко, безпечно та без високих бар'єрів входу впроваджувати індивідуальні рішення на основі штучного інтелекту.

Керована платформа штучного інтелекту — це ваше комплексне та безтурботне рішення для штучного інтелекту. Замість того, щоб мати справу зі складними технологіями, дорогою інфраструктурою та тривалими процесами розробки, ви отримуєте готове рішення, адаптоване до ваших потреб, від спеціалізованого партнера — часто всього за кілька днів.

Основні переваги з першого погляду:

⚡ Швидке впровадження: від ідеї до готового до використання застосунку за лічені дні, а не місяці. Ми пропонуємо практичні рішення, які створюють негайну додану цінність.

🔒 Максимальна безпека даних: Ваші конфіденційні дані залишаються з вами. Ми гарантуємо безпечну та відповідність вимогам обробку без передачі даних третім особам.

💸 Без фінансових ризиків: Ви платите лише за результат. Повністю виключаються значні початкові інвестиції в обладнання, програмне забезпечення чи персонал.

🎯 Зосередьтеся на своєму основному бізнесі: Зосередьтеся на тому, що ви робите найкраще. Ми подбаємо про повне технічне впровадження, експлуатацію та обслуговування вашого рішення на базі штучного інтелекту.

📈 Орієнтований на майбутнє та масштабований: Ваш ШІ зростає разом з вами. Ми забезпечуємо постійну оптимізацію та масштабованість, а також гнучко адаптуємо моделі до нових вимог.

Більше інформації тут:

 

Вплив GPT-6 Sol та Luna на бізнес

Проміжне зберігання стає недооціненим фактором витрат

Окрім видимих ​​цін на токени, OpenAI покращує кешування повторюваного введення. Завдяки так званому оперативному кешуванню, ідентичні фрагменти контексту не потрібно повністю обробляти повторно з кожним запитом. GPT-6 надає 90-відсоткову знижку на раніше зчитані, кешовані вхідні токени. Це особливо актуально для агентів, довгих розмов і програм з обширними системними інструкціями.

Бізнес-агент часто отримує одну й ту саму інформацію на кожному кроці: опис ролі, правила безпеки, структури даних, визначення інструментів, посібники або частини попередньої розмови. Без ефективного кешування цей контекст обробляється багаторазово з повною вартістю. У багатоетапних процесах повторюваний контекст може становити більшу складову витрат, ніж фактичний новий запит. Тому високий коефіцієнт потрапляння до кешу впливає на економічну ефективність більше, ніж можна було б припустити з точки зору ціни.

OpenAI тепер дозволяє розробникам змінювати обчислювальну інтенсивність та доступні інструменти, не втрачаючи попереднього контексту кешування. Крім того, розробники можуть встановлювати явні точки зупинки, щоб вказати, яка частина вхідних даних використовується повторно. GitHub повідомляє, що ці покращення зменшили частку токенів запитів, які довелося обробляти заново в мільярдах запитів Copilot, більш ніж на 50 відсотків протягом кількох місяців.

Для практичних цілей це призводить до чіткого пріоритету: оптимізація витрат починається не з вибору моделі. Вона також охоплює структуру вхідних даних, порядок стабільного та змінного вмісту, тривалість контексту та кількість непотрібних повторень. Погано розроблений додаток може бути дорогим, незважаючи на використання недорогих моделей. І навпаки, добре спланована архітектура може стратегічно використовувати високоякісні моделі, не перевищуючи бюджет.

Дешевші токени не означають автоматично менші рахунки

Ринок штучного інтелекту (ШІ) переживає надзвичайне падіння цін протягом багатьох років. Тільки з листопада 2022 року по жовтень 2024 року вартість досягнення приблизно такого ж рівня продуктивності, як у GPT-3.5, у широко використовуваному тесті на розуміння природної мови впала з 20 доларів до семи центів за мільйон токенів. Це означає зменшення більш ніж у 280 разів. GPT-6 Sol та Luna продовжують цю тенденцію, хоча й на вищому рівні можливостей.

З економічної точки зору, тут діє механізм, подібний до парадоксу Джевонса. Якщо використання ресурсу стає ефективнішим і дешевшим, загальне споживання не обов'язково зменшується. Часто воно зростає, оскільки нові програми стають економічно вигідними. Компанія, яка раніше використовувала штучний інтелект лише для створення кількох високоякісних текстів, тепер може аналізувати кожен запит клієнта, класифікувати кожен документ і автоматично перевіряти багато змін у програмному забезпеченні за значно нижчими цінами. У цьому випадку споживання зростає швидше, ніж падає ціна за одиницю.

Агентні програми посилюють цей ефект. Один запит користувача може ініціювати десять або двадцять викликів моделі. Агент планує, шукає інформацію, використовує інструменти, перевіряє проміжні результати та перезапускає систему, якщо виникають помилки. Тому видимий запит не є відповідною одиницею витрат. Важливими є загальні витрати на кожну успішно виконану операцію.

Тому компанії не повинні запитувати, яка модель продає найдешевші токени. Вони повинні вимірювати, скільки коштує правильний, своєчасний та перевірений результат. Цей розрахунок включає виклики моделей, витрати на пошук та інструменти, інфраструктуру, людський нагляд, виправлення помилок та потенційні збитки. Тільки цей комплексний аналіз показує, що є більш економічно вигідним: Sol чи Luna.

Атака OpenAI на Anthropic є цілеспрямованою

В оголошенні Sol та Luna часто порівнюються з моделями Anthropic. Це не випадково. Claude вважається сильним постачальником послуг програмування, довгих контекстів та вимогливої ​​роботи з знаннями в багатьох компаніях та командах розробників. Тому OpenAI орієнтований не лише на абстрактну пікову продуктивність, але й на ті сфери застосування, в яких Anthropic завоював надійну позицію на ринку.

Різниця в ціні очевидна. Купівля GPT-6 Sol коштує два долари США, а випуск – десять доларів США за мільйон токенів. Claude Opus 5 коштує п'ять і 25 доларів США відповідно, а Claude Fable 5.1 – десять і 50 доларів США відповідно. Таким чином, на папері Sol коштує на 60 відсотків менше, ніж Opus 5, і на 80 відсотків менше, ніж Fable 5.1. GPT-6 Luna ще більше занижує ці ціни.

Однак ключова частина повідомлення полягає не в тому, щоб називати «дешевше за токен», а в тому, щоб «дешевше за завдання». OpenAI намагається продемонструвати, що його моделі залишаються більш економічно ефективними навіть з урахуванням різної обчислювальної інтенсивності, тривалості відгуку та використання інструментів. Саме тому компанія публікує інформацію про вартість завдання на AutomationBench, DeepSWE та OSWorld. Цей показник є принципово більш значущим, ніж сама лише ціна.

Тим не менш, порівняння не є повністю нейтральними. OpenAI проводить аналізи у власному дослідницькому середовищі або через власний API. Деякі дані конкурентів взяті з публічно доступних звітів, а дані для Claude Fable 5 використовуються, коли дані для Fable 5.1 недоступні. Крім того, аналіз витрат для AutomationBench з Fable 5.1 є неповним, оскільки використання Opus 5 не було включено приблизно до 40 відсотків завдань. Це робить порівняння більш сприятливим для Anthropic, але також демонструє, наскільки важко досягти повністю стандартизованого вимірювання.

Орієнтири виробника надають докази, але не судження

Для вимірювання прогресу необхідні контрольні показники. Однак вони не дають об'єктивної загальної оцінки. Результати залежать від версії тесту, налаштувань системи, інструментів, обчислювального бюджету, кількості випробувань та методів оцінювання. Навіть різні налаштування обчислювальної інтенсивності можуть суттєво вплинути на цінність та витрати. Під час порівняння моделей з різними бюджетами, очевидна різниця в якості може бути просто результатом додаткових обчислювальних зусиль.

Щодо GPT-6, також важливо зазначити, що багато ключових тверджень походять з власної публікації OpenAI. Компанія має детальні знання про свої моделі, але також має інтерес до продажів. Тому до опублікованих результатів слід ставитися серйозно, але доповнювати їх незалежним тестуванням. Особливо невеликі відмінності, такі як 1,1 відсоткового пункту між Sol та Claude Fable 5 у DeepSWE, можуть потрапляти в межі практичної похибки.

Навіть високий бал у бенчмарку не гарантує гарної продуктивності в конкретній організації. Внутрішні документи, спеціалізована термінологія, застаріле програмне забезпечення, певні правила відповідності та суперечливі дані можуть негативно вплинути на результати. І навпаки, модель може працювати краще у вузько визначеному, добре задокументованому процесі, ніж у загальному тесті.

Тому найнадійнішим методом закупівель є спеціальний набір оцінок, заснований на реальних завданнях. Він повинен включати загальні стандартні випадки, складні граничні випадки та навмисно ризиковані ситуації. Вимірювання повинні охоплювати не лише точність і вартість, але й час обробки, стабільність, простежуваність та необхідне втручання людини. Зміна моделі є економічно виправданою лише в тому випадку, якщо ця оцінка демонструє суттєву перевагу.

Чіткіша мова зменшує непрямі витрати процесу

OpenAI обіцяє не лише технічні покращення, але й чіткіший стиль спілкування. Sol та Luna мають використовувати менше жаргону, менше незвичайних формулювань та менше недоречних деталей. Відповіді мають бути дещо коротшими, не втрачаючи при цьому суті. Ця зміна спочатку може здатися косметичною, але вона може мати значні економічні наслідки.

Нечіткі відповіді призводять до подальших запитань, неправильних інтерпретацій та додаткових зусиль на обробку. У розробці програмного забезпечення розпливчастий опис може приховати, що саме тестувалося. У спілкуванні з клієнтами зайвий технічний жаргон може знизити ясність. В аналізі довгі, але беззмістовні уривки можуть збільшити зусилля на тестування. Таким чином, точне та лаконічне спілкування не лише покращує взаємодію з користувачем, але й знижує витрати на процес.

Водночас стиль залишається суб'єктивним. Коротші відповіді не є автоматично кращими. Для юридичних, технічних або критично важливих для безпеки тем може знадобитися детальне пояснення. Тому компанії повинні визначити власні рекомендації щодо структури, тону, рівня деталізації та позначення невизначеностей. Якість комунікації залежить від взаємодії моделі, системних інструкцій та контролю якості.

Ще одне покращення стосується чесності щодо виконаних дій. OpenAI повідомляє про зниження рівня оманливих заяв щодо виконаних завдань програмування. Це критично важливо для агентів. Система, яка стверджує, що проводила тести або перевіряла файли, хоча цього не було, створює небезпечне відчуття безпеки. Покращення в цій галузі важливіші, ніж просто стилістичне полірування.

Безпека та відповідальність залишаються поза межами ціни

OpenAI пояснює, що Sol та Luna покращили узгодженість та безпеку порівняно з їхніми попередниками GPT 5.6. Це включає перевірки на наявність оманливої ​​інформації в завданнях програмування, обхід попереджень та несанкціоновані взаємодії. Ці тести навмисно складні та не відображають типове використання. Швидше, вони демонструють, як моделі поводяться в проблемних умовах.

Для компаній вищий бал безпеки не означає, що можна відмовитися від технічних та організаційних заходів безпеки. Моделі вимагають чітко визначених прав, окремих середовищ розробки та виробництва, ведення журналу, контролю доступу та схвалення конфіденційних дій. Під час роботи з персональними даними також необхідно враховувати захист даних, політики зберігання та регіональну обробку. У регульованих секторах результати повинні бути відстежуваними, а обов'язки чітко визначеними.

Парадоксально, але низькі ціни можуть створити нові ризики. Якщо Luna стане настільки дешевою, що можливими стануть мільйони автоматизованих рішень, ймовірність систематичної помилки зросте. Несправний класифікатор, хибне правило або спотворений набір даних можуть вплинути на дуже велику кількість випадків. Вартість одного запиту зменшується, але потенційна загальна шкода зростає зі збільшенням обсягу.

Тому компанії не повинні скорочувати бюджети на безпеку та якість пропорційно цінам токенів. Навпаки: чим більше масштабується модель, тим важливішими стають механізми моніторингу, вибірки та вимкнення. Економічне масштабування без управління неефективне, а радше переносить витрати на майбутнє.

Справжнє нововведення полягає в оркестрації моделі

Sol та Luna пропонують багаторівневу архітектуру. Luna може обробляти великі обсяги простих завдань, одночасно оцінюючи, чи є випадок небезпечним або незвичайним. Sol обробляє складніші винятки. Astra залишається зарезервованою для особливо складних або критично важливих для бізнесу завдань. Крім того, правила можуть визначати, коли потрібне втручання людини.

Такий каскад поєднує низькі середні витрати з високою піковою продуктивністю. Однак його успіх залежить від логіки маршрутизації. Якщо Luna не виявляє складні справи, виникають проблеми з якістю. Якщо занадто багато справ превентивно перенаправляється до Sol або Astra, перевага у вартості зникає. Таким чином, класифікація складності завдань сама по собі стає основною функцією ШІ.

Також можна об'єднувати різних постачальників. Компанія не повинна повністю прив'язуватися до OpenAI або Anthropic. Вона може розподіляти моделі на основі завдання, регіону, доступності та ціни. Такий багатопостачальниковий підхід зменшує залежності та підвищує надійність. Однак він також створює додаткові зусилля на інтеграцію та тестування, оскільки моделі мають різні інтерфейси, формати інструментів та поведінку.

У довгостроковій перспективі конкуренція навряд чи буде визначатися виключно між окремими моделями. Платформи, які автоматично маршрутизують запити, контролюють витрати, вимірюють якість та обмінюються моделями за потреби, матимуть вирішальне значення. Sol та Luna збільшують переваги таких систем, оскільки різниця в цінах між рівнями достатньо велика, щоб зробити інтелектуальний розподіл економічно привабливим.

Переможці та переможені нового призового раунду

Серед безпосередніх переможців – розробники додатків штучного інтелекту з високими обсягами використання. Сервіси з обробки документів, підтримки, розробки програмного забезпечення, очищення даних та досліджень можуть значно зменшити їхні змінні витрати. Стартапи виграють, оскільки можуть проводити більше експериментів з меншим капіталом. Середні компанії отримують доступ до можливостей, які раніше були життєздатними лише з більшими бюджетами.

Користувачі спеціалізованого програмного забезпечення також можуть отримати вигоду. Якщо постачальники послуг переходять на нижчі витрати на моделі, функції штучного інтелекту можна інтегрувати в існуючі підписки без значного підвищення цін. Однак, більш імовірно, що частина заощаджень залишиться у постачальників програмного забезпечення як маржа. Конкуренція визначатиме, яка частина з цього фактично дійде до клієнта.

Постачальники, чия бізнес-модель переважно базується на перепродажі дорогого доступу до моделей, зазнають тиску. Оскільки базова технологія стає дешевшою та потужнішою, цінність простих інтерфейсів користувача та взаємозамінних додаткових функцій зменшується. Стала диференціація виникає завдяки власним даним, глибокій інтеграції процесів, галузевим знанням, безпеці та видимим результатам.

Постачальники антропних та інших моделей також стикаються зі стратегічним рішенням. Вони можуть знизити ціни, розширити свої основні можливості або виділити певні переваги в безпеці, зручності використання та розгортанні на рівні підприємств. Чиста цінова конкуренція надає перевагу постачальникам з великою інфраструктурою, високим рівнем використання та доступом до капіталу. Менші лабораторії можуть більше зосередитися на відкритих моделях, спеціалізованих нішах або суверенному розгортанні.

Що саме компаніям слід перевіряти зараз

Перше завдання — розбити існуючі витрати на штучний інтелект за процесами, а не за моделями. Компаніям потрібна прозорість щодо того, скільки вхідних, вихідних та буферних токенів споживає повний процес. Крім того, необхідно відстежувати виклики інструментів, повторення та час перевірки людиною. Без цих даних економічні вигоди від переходу неможливо достовірно визначити.

Після цього мають бути проведені реальні порівняльні випробування між раніше використовуваними моделями GPT-6 Sol та GPT-6 Luna. Luna є природним кандидатом для великих обсягів та чітко структурованих завдань. Sol підходить для складних аналізів, триваліших процесів та вимогливих програмних застосувань. Для особливо складних завдань модель вищого рівня все ще може бути економічною, якщо вона уникає повторень та помилок.

Поспішна, повна міграція була б нерозумною. Нові моделі, незважаючи на вищу середню продуктивність, можуть мати різні профілі помилок. Вихідні дані можуть змінюватися за форматом, довжиною або тоном, тим самим порушуючи роботу наступних систем. Рекомендується поетапне впровадження з паралельним виконанням, автоматизованими перевірками якості та чіткими резервними варіантами.

Контракти та технічна архітектура також повинні сприяти переходу на іншу модель. Особливості, характерні для певних постачальників, можуть бути зручними в короткостроковій перспективі, але збільшують витрати на перехід у майбутньому. Стандартизовані формати даних, окрема логіка оцінки та централізоване ведення журналу допомагають швидше тестувати нові моделі. На ринку з падінням цін та короткими циклами продукції готовність до переходу стає конкурентною перевагою.

Крок уперед із тривожним значенням

GPT-6 Sol та Luna не є доказом того, що штучний інтелект зараз безпомилковий, автономний або універсально застосовний. Опубліковані показники успішності все ще виявляють значні прогалини. Навіть сильні моделі регулярно не проходять вимогливі професійні та технічні тести. Тому ці моделі не замінюють потреби в чітких процесах, достовірних даних та відповідальному нагляді.

Їхнє економічне значення полягає в іншому. OpenAI настільки різко знижує ціну на передовий штучний інтелект, що нові програми стають прибутковими, а існуючі системи можна використовувати частіше. Sol пропонує потужні агентні та технічні можливості за значно нижчою ціною. Luna робить великі обсяги простих та середніх завдань майже масовою інфраструктурною послугою.

Найважливішим показником тут є не ціна за мільйон токенів, і це не єдине контрольне значення. Важлива ціна надійно вирішеної бізнес-проблеми. Sol та Luna, здається, значно покращують ці відносини, але дані постачальників потребують перевірки в реальних бізнес-середовищах. Ті, хто просто купує дешевші токени, можуть зрештою витратити більше. Натомість ті, хто стратегічно використовує моделі, кешує повторюваний контекст і систематично вимірює якість, можуть досягти справжнього стрибка продуктивності.

Таким чином, «Сонце» та «Луна» знаменують собою не стільки кінець технологічної гонки, скільки початок жорсткішої економічної конкуренції. Інтелект стає дешевшим, але його успішне використання залишається складним завданням. Перевага зміщується від компаній, які мають доступ до єдиної надійної моделі, до тих, хто може точно організувати багато моделей, розуміти свої витрати та послідовно керувати своїми помилками. Саме в цьому полягає справжня провокація цієї публікації: дефіцитом стає не штучний інтелект, скільки здатність організувати його економічно вигідним способом.

 

🎯🎯🎯 Галузевий центр B2B, керований даними, як квазі-внутрішнє рішення

Квазі-власне рішення: Як Xpert.Digital усуває операційні прогалини в B2B-маркетингу та продажах – Розумний контент-орієнтований бізнес - Зображення: Xpert.Digital

Xpert.Digital — це галузевий центр B2B, що базується на даних, який очолює Konrad Wolfenstein . Компанія виступає зовнішнім, квазі-внутрішнім рішенням для промислових партнерів, усуваючи операційні прогалини в маркетингу, контенті та продажах, не вимагаючи додаткових ресурсів з боку клієнта.

Більше інформації тут:

 

Ваш глобальний партнер з маркетингу та розвитку бізнесу

☑️ Наша ділова мова – англійська або німецька

☑️ НОВИНКА: Листування вашою рідною мовою!

 

Konrad Wolfenstein

Я та моя команда раді бути вашим особистим консультантом.

Ви можете зв'язатися зі мною, заповнивши контактну форму тут wolfenstein@xpert.digital:, або просто зателефонувавши мені за номером +49 7348 4088 965. Моя адреса електронної пошти

Я з нетерпінням чекаю нашого спільного проєкту.

 

 

☑️ Підтримка МСП у стратегії, консалтингу, плануванні та впровадженні

☑️ Створення або переорієнтація цифрової стратегії та діджиталізації

☑️ Розширення та оптимізація процесів міжнародних продажів

☑️ Глобальні та цифрові торгові платформи B2B

☑️ Розвиток бізнесу Pioneer / Маркетинг / PR / Виставки

Залиште мобільну версію