Фактчек @ecotopor: правда ли, что ИИ уже выполняет две трети офисных задач на ПК
16 апреля 2026 года в 19:19:06 UTC (22:19:06 мск) Telegram-канал @ecotopor опубликовал пост с утверждением, что за два года ИИ научился выполнять две трети офисных задач на ПК и что после преодоления уровня человека в 72% можно будет всерьёз говорить о замене сотрудников. Проверяем, на каких исследованиях это вообще может быть основано, где авторы смешали разные метрики и насколько корректен такой вывод.
Исходная новость
Источник: https://t.me/ecotopor/9168
Пост утверждает, что:
- за два года ИИ научился выполнять две трети офисных задач на ПК;
- уровень человека равен 72%;
- после прохождения этой отметки можно будет говорить о замене сотрудников;
- пока же эксперты якобы считают, что ИИ скорее повысит эффективность офисных работников, чем отнимет у них работу.
Короткое резюме о новости
Пост основан на реальных исследованиях о прогрессе ИИ, но пересказывает их неточно и слишком широко. Подтверждается, что существует benchmark OSWorld по компьютерным задачам, где человеческий ориентир действительно составляет 72,36%, а также что свежее исследование MIT FutureTech говорит о высоком и быстро растущем качестве выполнения текстовых рабочих задач ИИ. Но не подтверждается формула «ИИ уже выполняет две трети офисных задач на ПК» как установленный факт. В доступных первоисточниках речь идёт о разных вещах: об успехах на benchmark по управлению компьютером и отдельно о текстовых задачах на «минимально достаточном» уровне качества. Пост смешивает эти числа в один громкий вывод и добавляет неочевидный тезис о пороге замены сотрудников.
Новостиметр с пояснениями каждого пункта
- Пиздежеметр: ★★★★☆
Причина: в посте смешаны разные исследования и разные метрики, а вывод расширен с benchmark по компьютерным действиям и текстовым задачам до всей офисной работы на ПК. - Пруфометр: ★★☆☆☆
Причина: в посте нет ссылки ни на конкретное исследование, ни на benchmark, ни на методику, ни на автора тезиса про «72% как порог замены сотрудников». - Паникерометр: ★★☆☆☆
Причина: подача тревожная, но не апокалиптическая; страх создаёт именно фраза про возможную замену сотрудников. - Гойдометр: ★☆☆☆☆
Причина: идеологической или патриотической рамки почти нет; это скорее хайповый техно-прогноз.
Что подтвердилось в новости
- Подтвердилось, что существует реальный benchmark по компьютерным задачам. Официальный сайт OSWorld описывает benchmark как набор из 369 реальных компьютерных задач в вебе и desktop-приложениях. Там же указано, что люди выполняют более 72,36% задач: https://os-world.github.io/.
- Подтвердилось, что отметка 72,36% относится к человеческому уровню в одном конкретном benchmark, а не ко всей офисной работе. Это видно и на сайте OSWorld, и в статье OSWorld-Human, где исследователи отдельно анализируют эффективность computer-use agents относительно человеческих траекторий: https://os-world.github.io/, https://arxiv.org/abs/2506.16042.
- Подтвердилось, что MIT в апреле 2026 года действительно выпустил свежее исследование о рабочих задачах и ИИ. MIT CSAIL 2 апреля 2026 года сообщила, что среди текстовых задач, которые могут быть выполнены LLM, модели смогли выполнить 60% на уровне “minimally sufficient”, а только 26% — на “superior” уровне качества: https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers.
- Подтвердилось, что MIT FutureTech говорит о быстром росте возможностей ИИ, но не о полном замещении офисных работников уже сейчас. В публикации “Crashing Waves vs. Rising Tides” говорится, что в 2024-Q2 модели справлялись с текстовыми задачами длительностью 3-4 часа примерно в 50% случаев, а к 2025-Q3 — примерно в 65%, при этом до near-perfect качества нужен дополнительный срок: https://futuretech.mit.edu/publication/crashing-waves-vs-rising-tides-preliminary-findings-on-ai-automation-from-thousands-of-worker-evaluations-of-labor-market-tasks, https://arxiv.org/abs/2604.01363.
Что не подтвердилось или искажено в новости. Описание разоблачения со ссылками
- Не подтверждено, что ИИ уже выполняет именно две трети офисных задач на ПК как установленный научный факт.
В доступных первоисточниках нет формулы в таком виде. У OSWorld 72,36% — это человеческий ориентир в benchmark по компьютерным задачам, а не текущий «официальный» уровень ИИ по всей офисной работе: https://os-world.github.io/, https://arxiv.org/abs/2506.16042. - Смешаны разные классы задач и разные метрики.
MIT FutureTech исследует текстовые рабочие задачи и оценивает результат по шкале качества, где “minimally sufficient” не равен “полностью заменяет сотрудника”. OSWorld — это другой benchmark: там проверяются действия в графическом интерфейсе и реальных приложениях. Смешивать эти исследования в одну цифру некорректно: https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers, https://os-world.github.io/. - Искажён смысл числа 72%.
В посте 72% подаётся как почти официальный рубеж, после которого можно говорить о замене сотрудников. Но в проверяемых источниках это число связано с человеческим baseline в одном benchmark, а не с признанным рынком труда порогом автоматизации: https://os-world.github.io/, https://arxiv.org/abs/2506.16042. - Не подтверждено, что unnamed “эксперты” именно так формулируют общий вывод.
В посте нет ссылки ни на конкретного автора, ни на исследование, ни на цитату. MIT, наоборот, прямо пишет, что 2027 год как срок широкого «затмения» человеческой работы слишком агрессивен, хотя прогресс и быстрый: https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers. - Искажена текущая картина по benchmark OSWorld-Verified.
В блоге XLANG Lab о запуске OSWorld-Verified от 28 июля 2025 года прямо сказано, что benchmark остаётся сложным и до human-level performance ещё есть значительный запас. То есть даже сами авторы benchmark не описывали ситуацию как уже достигнутую массовую замену офисной работы: https://xlang.ai/blog/osworld-verified.
Факты, оценки и предположения отдельно
- Факты: существует benchmark OSWorld; человеческий baseline там 72,36%; MIT в апреле 2026 года сообщила о 60% “minimally sufficient” для текстовых задач и только 26% “superior” качества.
- Оценки: пост @ecotopor заметно расширяет и драматизирует выводы исследований, превращая разные академические метрики в простой тезис про «две трети офисных задач».
- Предположения: вероятнее всего, авторы поста пересказали популярный медиавывод о росте computer-use agents и наложили его на свежие MIT-данные про текстовую работу, не разделив эти исследования по смыслу.
Блок с правильным текстом новости
Корректнее эту новость стоило бы написать так:
«16 апреля 2026 года Telegram-канал @ecotopor сообщил, что ИИ якобы уже выполняет две трети офисных задач на ПК. Проверка показывает, что такой тезис в доступных первоисточниках сформулирован слишком широко. Существует benchmark OSWorld по работе ИИ с реальными компьютерными интерфейсами, где человеческий baseline составляет 72,36%, но это не универсальная мера всей офисной работы: https://os-world.github.io/, https://arxiv.org/abs/2506.16042. Отдельно MIT CSAIL и MIT FutureTech в апреле 2026 года сообщили, что LLM уже способны выполнять значительную часть текстовых рабочих задач на минимально достаточном уровне качества, однако речь шла о 60% среди текстовых задач, а не о “двух третях всей офисной работы на ПК”; при этом только 26% результатов получили superior quality, а прогнозы о полном замещении работников названы преждевременными: https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers, https://futuretech.mit.edu/publication/crashing-waves-vs-rising-tides-preliminary-findings-on-ai-automation-from-thousands-of-worker-evaluations-of-labor-market-tasks, https://arxiv.org/abs/2604.01363. Поэтому точнее говорить так: ИИ быстро прогрессирует и уже хорошо справляется с частью текстовых и компьютерных задач, но пост @ecotopor завышает уровень доказанности и смешивает разные исследования в одну громкую цифру».
Все использованные ссылки
- https://t.me/ecotopor/9168
- https://os-world.github.io/
- https://xlang.ai/blog/osworld-verified
- https://arxiv.org/abs/2506.16042
- https://www.csail.mit.edu/news/new-mit-research-overturns-prior-view-about-how-ai-capabilities-could-overtake-human-workers
- https://futuretech.mit.edu/publication/crashing-waves-vs-rising-tides-preliminary-findings-on-ai-automation-from-thousands-of-worker-evaluations-of-labor-market-tasks
- https://arxiv.org/abs/2604.01363
Применённые категории: Фактчекинг и разоблачения, Технологии и интернет
Применённые теги: @ecotopor, искусственный интеллект, MIT CSAIL, OSWorld, рынок труда, автоматизация труда, офисные задачи