Фактчек @ecotopor: правда ли, что ИИ уже выполняет две трети офисных задач на ПК - Fuckt Чекер
Технологии и интернетФактчекинг и разоблачения

Фактчек @ecotopor: правда ли, что ИИ уже выполняет две трети офисных задач на ПК

16 апреля 2026 года в 19:19:06 UTC (22:19:06 мск) Telegram-канал @ecotopor опубликовал пост с утверждением, что за два года ИИ научился выполнять две трети офисных задач на ПК и что после преодоления уровня человека в 72% можно будет всерьёз говорить о замене сотрудников. Проверяем, на каких исследованиях это вообще может быть основано, где авторы смешали разные метрики и насколько корректен такой вывод.

Исходная новость

Источник: https://t.me/ecotopor/9168

Пост утверждает, что:

  • за два года ИИ научился выполнять две трети офисных задач на ПК;
  • уровень человека равен 72%;
  • после прохождения этой отметки можно будет говорить о замене сотрудников;
  • пока же эксперты якобы считают, что ИИ скорее повысит эффективность офисных работников, чем отнимет у них работу.

Короткое резюме о новости

Пост основан на реальных исследованиях о прогрессе ИИ, но пересказывает их неточно и слишком широко. Подтверждается, что существует benchmark OSWorld по компьютерным задачам, где человеческий ориентир действительно составляет 72,36%, а также что свежее исследование MIT FutureTech говорит о высоком и быстро растущем качестве выполнения текстовых рабочих задач ИИ. Но не подтверждается формула «ИИ уже выполняет две трети офисных задач на ПК» как установленный факт. В доступных первоисточниках речь идёт о разных вещах: об успехах на benchmark по управлению компьютером и отдельно о текстовых задачах на «минимально достаточном» уровне качества. Пост смешивает эти числа в один громкий вывод и добавляет неочевидный тезис о пороге замены сотрудников.

Новостиметр с пояснениями каждого пункта

  • Пиздежеметр: ★★★★☆
    Причина: в посте смешаны разные исследования и разные метрики, а вывод расширен с benchmark по компьютерным действиям и текстовым задачам до всей офисной работы на ПК.
  • Пруфометр: ★★☆☆☆
    Причина: в посте нет ссылки ни на конкретное исследование, ни на benchmark, ни на методику, ни на автора тезиса про «72% как порог замены сотрудников».
  • Паникерометр: ★★☆☆☆
    Причина: подача тревожная, но не апокалиптическая; страх создаёт именно фраза про возможную замену сотрудников.
  • Гойдометр: ★☆☆☆☆
    Причина: идеологической или патриотической рамки почти нет; это скорее хайповый техно-прогноз.

Что подтвердилось в новости

  • Подтвердилось, что существует реальный benchmark по компьютерным задачам. Официальный сайт OSWorld описывает benchmark как набор из 369 реальных компьютерных задач в вебе и desktop-приложениях. Там же указано, что люди выполняют более 72,36% задач: https://os-world.github.io/.
  • Подтвердилось, что отметка 72,36% относится к человеческому уровню в одном конкретном benchmark, а не ко всей офисной работе. Это видно и на сайте OSWorld, и в статье OSWorld-Human, где исследователи отдельно анализируют эффективность computer-use agents относительно человеческих траекторий: https://os-world.github.io/, https://arxiv.org/abs/2506.16042.
  • Подтвердилось, что MIT в апреле 2026 года действительно выпустил свежее исследование о рабочих задачах и ИИ. MIT CSAIL 2 апреля 2026 года сообщила, что среди текстовых задач, которые могут быть выполнены LLM, модели смогли выполнить 60% на уровне “minimally sufficient”, а только 26% — на “superior” уровне качества: https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers.
  • Подтвердилось, что MIT FutureTech говорит о быстром росте возможностей ИИ, но не о полном замещении офисных работников уже сейчас. В публикации “Crashing Waves vs. Rising Tides” говорится, что в 2024-Q2 модели справлялись с текстовыми задачами длительностью 3-4 часа примерно в 50% случаев, а к 2025-Q3 — примерно в 65%, при этом до near-perfect качества нужен дополнительный срок: https://futuretech.mit.edu/publication/crashing-waves-vs-rising-tides-preliminary-findings-on-ai-automation-from-thousands-of-worker-evaluations-of-labor-market-tasks, https://arxiv.org/abs/2604.01363.

Что не подтвердилось или искажено в новости. Описание разоблачения со ссылками

  • Не подтверждено, что ИИ уже выполняет именно две трети офисных задач на ПК как установленный научный факт.
    В доступных первоисточниках нет формулы в таком виде. У OSWorld 72,36% — это человеческий ориентир в benchmark по компьютерным задачам, а не текущий «официальный» уровень ИИ по всей офисной работе: https://os-world.github.io/, https://arxiv.org/abs/2506.16042.
  • Смешаны разные классы задач и разные метрики.
    MIT FutureTech исследует текстовые рабочие задачи и оценивает результат по шкале качества, где “minimally sufficient” не равен “полностью заменяет сотрудника”. OSWorld — это другой benchmark: там проверяются действия в графическом интерфейсе и реальных приложениях. Смешивать эти исследования в одну цифру некорректно: https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers, https://os-world.github.io/.
  • Искажён смысл числа 72%.
    В посте 72% подаётся как почти официальный рубеж, после которого можно говорить о замене сотрудников. Но в проверяемых источниках это число связано с человеческим baseline в одном benchmark, а не с признанным рынком труда порогом автоматизации: https://os-world.github.io/, https://arxiv.org/abs/2506.16042.
  • Не подтверждено, что unnamed “эксперты” именно так формулируют общий вывод.
    В посте нет ссылки ни на конкретного автора, ни на исследование, ни на цитату. MIT, наоборот, прямо пишет, что 2027 год как срок широкого «затмения» человеческой работы слишком агрессивен, хотя прогресс и быстрый: https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers.
  • Искажена текущая картина по benchmark OSWorld-Verified.
    В блоге XLANG Lab о запуске OSWorld-Verified от 28 июля 2025 года прямо сказано, что benchmark остаётся сложным и до human-level performance ещё есть значительный запас. То есть даже сами авторы benchmark не описывали ситуацию как уже достигнутую массовую замену офисной работы: https://xlang.ai/blog/osworld-verified.

Факты, оценки и предположения отдельно

  • Факты: существует benchmark OSWorld; человеческий baseline там 72,36%; MIT в апреле 2026 года сообщила о 60% “minimally sufficient” для текстовых задач и только 26% “superior” качества.
  • Оценки: пост @ecotopor заметно расширяет и драматизирует выводы исследований, превращая разные академические метрики в простой тезис про «две трети офисных задач».
  • Предположения: вероятнее всего, авторы поста пересказали популярный медиавывод о росте computer-use agents и наложили его на свежие MIT-данные про текстовую работу, не разделив эти исследования по смыслу.

Блок с правильным текстом новости

Корректнее эту новость стоило бы написать так:

«16 апреля 2026 года Telegram-канал @ecotopor сообщил, что ИИ якобы уже выполняет две трети офисных задач на ПК. Проверка показывает, что такой тезис в доступных первоисточниках сформулирован слишком широко. Существует benchmark OSWorld по работе ИИ с реальными компьютерными интерфейсами, где человеческий baseline составляет 72,36%, но это не универсальная мера всей офисной работы: https://os-world.github.io/, https://arxiv.org/abs/2506.16042. Отдельно MIT CSAIL и MIT FutureTech в апреле 2026 года сообщили, что LLM уже способны выполнять значительную часть текстовых рабочих задач на минимально достаточном уровне качества, однако речь шла о 60% среди текстовых задач, а не о “двух третях всей офисной работы на ПК”; при этом только 26% результатов получили superior quality, а прогнозы о полном замещении работников названы преждевременными: https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers, https://futuretech.mit.edu/publication/crashing-waves-vs-rising-tides-preliminary-findings-on-ai-automation-from-thousands-of-worker-evaluations-of-labor-market-tasks, https://arxiv.org/abs/2604.01363. Поэтому точнее говорить так: ИИ быстро прогрессирует и уже хорошо справляется с частью текстовых и компьютерных задач, но пост @ecotopor завышает уровень доказанности и смешивает разные исследования в одну громкую цифру».

Все использованные ссылки

  • https://t.me/ecotopor/9168
  • https://os-world.github.io/
  • https://xlang.ai/blog/osworld-verified
  • https://arxiv.org/abs/2506.16042
  • https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers
  • https://futuretech.mit.edu/publication/crashing-waves-vs-rising-tides-preliminary-findings-on-ai-automation-from-thousands-of-worker-evaluations-of-labor-market-tasks
  • https://arxiv.org/abs/2604.01363

Применённые категории: Фактчекинг и разоблачения, Технологии и интернет

Применённые теги: @ecotopor, искусственный интеллект, MIT CSAIL, OSWorld, рынок труда, автоматизация труда, офисные задачи

Avatar photo

Редакция Fuckt Чекер

Редакция проекта «Fuckt Чекер». Публикуем разборы новостей и фактчекинг с опорой на первоисточники, официальные документы и проверяемые данные.