
Первая публичная версия ChatGPT-3.5 Turbo вышла 30 ноября 2022 года, набрав первый миллион пользователей меньше, чем за неделю. С тех пор нейросети стали умнее по самым строгим тестам, а их работа для конечного пользователя подешевела на два порядка: единица интеллекта на доллар в сентябре 2026 стоит примерно в 200 раз меньше, чем в ноябре 2022.
Инференс подешевел в 50–100 раз
Себестоимость токенов – то, что провайдер тратит на аренду GPU и электричество – упала за четыре года в 50–100 раз, до 188 раз в некоторых случаях.
В конце 2022 года запустить GPT-3 на топовом тогда GPU NVIDIA A100 стоило около $0,80–1,50 за миллион выходных токенов. Модель была dense (это когда все 175 миллиардов параметров обрабатываются при каждом запросе), вычисления шли в кванте FP16.
В сентябре 2026 года DeepSeek V4 Flash на H100 стоит $0,02–0,04 за миллион токенов: модель в десять раз больше, но одновременно работает только 49 миллиардов активных параметров из 671 благодаря архитектуре MoE, и вычислениям в FP8. На новейшем B200 в FP4 миллион токенов ещё дешевле – $0,008–0,015.
Падение себестоимости складывается из четырёх источников. Железо дало падение в 3,5 раза: A100 с 312 TFLOPS BF16 уступил место H100 с 1979 TFLOPS и B200 с примерно 4500 TFLOPS FP8, при сопоставимой цене аренды.
Архитектура MoE дала ещё 5–20 раз: DeepSeek V3.1 активирует 37 миллиардов из 671, Kimi K2 – 32 миллиарда из триллиона, Qwen3.8 – 95 миллиардов из 2,4 триллиона, остальные параметры в каждом запросе не используются.
Квантизация FP16 → FP8 → FP4 дала 2–4 раза за счёт сокращения потребности в оперативной памяти и пропускной способности шины.
Современный стек для запуска моделей – PagedAttention, continuous batching, speculative decoding, FlashAttention и так далее – дал ещё 5–20 раз к пропускной способности.
Модели стали в двадцать раз умнее
«Интеллект» моделей можно оценить с помощью Artificial Analysis Intelligence Index – композитный показатель, который сводит девять бенчмарков в одну цифру от 0 до 100. Бенчмарки взвешены по четырём категориям: agents – 34%, coding – 24%, scientific reasoning 24%, general – 18%.
По этой шкале GPT-3.5 Turbo (на 30 ноября 2022) получает 3 балла – это 67-я строчка из 81 модели в текущем рейтинге. Современный лидер – Claude Opus 5 / Fable 5.1 в режиме максимального рассуждения (сентябрь 2026) – набирает 63–66 баллов. Разница – в 20 раз.
Для пользователя «единица интеллекта» подешевела примерно в 200 раз
На доллар, потраченный на GPT-3.5 Turbo в ноябре 2022, можно было купить 1,5 «единиц интеллекта» по шкале Artificial Analysis. В сентябре 2026 на тот же доллар на DeepSeek V4 Flash приходится 289 единиц: 3 балла ÷ $2,00 за миллион токенов против 52 баллов ÷ $0,18. В 193 раза больше интеллекта за те же деньги!
Даже дорогие модели уровня Claude Opus 5 для задач, где качество важнее стоимости, в режиме максимального рассуждения стали выгоднее – он даёт 12,6 единиц на доллар (63 балла ÷ $5,00 blended) – в 8,4 раза больше GPT-3.5, хоть и в 23 раза меньше DeepSeek V4 Flash.
3% используют AI в полную силу
Но гораздо больше меня поражают другие цифры:
- До сих пор 49% людей в возрасте старше 12 лет ни разу не пробовали воспользоваться AI.
- 33% попробовали, и.. дело ограничилось только экспериментом.
- 15% применяют AI в работе регулярно, но пользуются при этом только бесплатными инструментами.
- И лишь 3% платят за AI, имея доступ ко всем его реальным возможностям!
На прошлой неделе я вел семинар «AI в производстве», и участники подтвердили эту статистику: ровно половина вообще не пользовалась AI, а среди оставшихся были только те, кто лишь немного экспериментировал с AI – кто-то чаще, а кто-то буквально считанные разы.
Для меня это выглядит примерно как если бы прямо сейчас 3% людей пользовались e-mail, 15% – писали бы письма исключительно от руки и бросали их в почтовый ящик, а 49% до сих пор возились бы с гусиными перьями и общались через голубиную почту – просто дичь какая-то.
Добро пожаловать в цивилизацию
Я прекрасно понимаю, что AI нельзя бездумно внедрять во все процессы подряд, но даже на производстве для него есть множество адекватных сфер применения: работа с организационной и технической документацией, планирование и аналитика, малая автоматизация, контроль качества продукции, мониторинг оборудования и так далее. В России уже есть много интересных кейсов, где AI используется в связке с RAG, системами компьютерного зрения и даже цифровыми двойниками.
Это не просто и не быстро – некоторые проекты стартовали несколько лет назад, а для AI это огромный срок. Поэтому задумываться о собственной AI-грамотности стоило уже позавчера, а сегодня нужно изо всех навёрстывать упущенное.
Простые шаги
Начните с создания аккаунтов на https://chat.qwen.ai, https://chat.deepseek.com – для экспериментов, а заодно и https://www.anthropic.com – просто чтобы почувствовать разницу.
Прочтите мою книжку «Главное про AI» – она даст вам системное представление о том, с чем вы имеете дело, какие у AI подводные камни и как в принципе его можно использовать. Для этого она и написана.
Поэкспериментируйте с AI на своих рабочих задачах – поработайте с реальными документами, поищите с его помощью нужную вам информацию, попробуйте сделать простенькое приложение, которого вам не хватало.
Потом ещё раз откройте книжку – и многое теперь станет понятнее.
После этого попробуйте поставить на свой компьютер агента Hermes (мой любимчик) или OpenClaw, подключить на месяц недорогую платную подписку на API за $20-50 (например https://www.minimax.io) и поиграть уже на новом уровне.
Ну а дальше всё будет зависеть от ваших вкусов и интересов. Главное – начать двигаться вперёд уже сейчас.
Друзья, подписывайтесь на мой Твиттер (там я пишу чаще) и Телеграм, чтобы получать анонсы новых материалов.








Комментариев: 0