Память Радианта: 15 из 15 против окна на 1 млн токенов
Автор проверил, найдёт ли агент Коворк сообщения пятилетней давности. Память Радианта вернула 15 из 15. Контекстное окно на миллион токенов дотянулось лишь до четырёх месяцев.
Главные деловые сюжеты дня — коротко, со ссылками на разборы.
Яндекс представил Sona: ИИ-модель рекомендаций сама подбирает и ранжирует контент.
ИИ-агент Коворк на платформе Радиант: долговременная память достала все 15 сообщений пятилетней давности из рабочей переписки.
Инструкция пригодится, если функцию в вашем продукте сейчас выполняет языковая модель, а вам кажется, что хватит обычных правил. Поводом может стать что угодно: жалобы на ошибки, недоступность без VPN, счёт за прогоны, растущий быстрее выручки. Разработчик приложения для управления финансами прошёл этот путь целиком: убрал модель из кнопки, раскладывающей накопления по целям, и заменил её детерминированным алгоритмом в одном файле. Разбор на Habr (https://habr.com/ru/articles/1088910/). Ниже - пошаговая методика такого же аудита.
Инструкция применима каждый раз, когда вы отдаёте нейросети разбор рабочего интерфейса - рекламного кабинета, CRM, отчёта в таблице - и собираетесь действовать по её выводам. Поводом стал разбор двух кабинетов Яндекс Директа в B2B-нише, где чек сделки измеряется миллионами: браузерный ИИ-помощник пять раз выдал уверенный вывод на основе неверно прочитанного интерфейса. Логика была чистой, тон ровным, а числа - не теми, что на экране. Ниже - порядок действий, который ловит такие ошибки до того, как на них потрачен бюджет.
Инструкция пригодится, если у вас работает 1С:ERP и нужна небольшая доработка — например, новый HTTP-метод для обмена с внешним сервисом, — а штатного разработчика 1С в компании нет или он занят другим. Поводом стал разбор на Habr: автор показал, как визуально-языковая модель Qwen3-VL через удалённый рабочий стол сама создала в 1С:ERP шаблон URL, HTTP-метод GET и обработчик, сохранила бэкап расширения и обновила конфигурацию базы — по картинке экрана и мыши, без доступа к файлам конфигурации (https://habr.com/ru/articles/1088750/). Материал подходит тем, кто готов выделить отдельную копию базы и час-два на постановку задачи, но не готов платить интегратору за мелкую правку. Он не подходит, если доработка затрагивает типовую конфигурацию без расширения, если задачу нельзя сформулировать словами или если вы не готовы заранее решить, что именно с вашего экрана увидит внешняя модель.
Самая важная цифра в этом кейсе - не 49%, а «три»: три автоматизации планировали, 26 внедрили. И именно потому, что автор разбора отказался приписывать рост выручки нейросетям, этому кейсу можно верить.
Автор открыл чат с ИИ-моделью, отправил 90 запросов и не написал ни строчки кода руками. Тесты он не запускал ни разу. Результат — в проде: мессенджер Calab 0.3.1, сборки под macOS, Windows, Linux, веб-версия и лендинг. Узким местом стал вовсе не код.
Нормализацию НСИ откладывают ровно потому, что она не приносит выручки. И это правда: считать её выгоду в выручке не надо. Счёт приходит в другом месте: в человеко-часах, которые никто не табелирует, и в рублях, размазанных по накладным, остаткам и повторным закупкам. Разбор SOFROS AI/ML на Habr ставит вопрос ребром: сколько компания теряет на «грязных» справочниках и сколько из этого возвращает нормализация - и возвращает ли вообще.
Разметить обратную связь одним запросом к модели - самый быстрый путь к отчёту, которому нельзя верить. Команда Авито Рекламы разложила эту работу по ролям: языковые задачи - агентам, механические - коду, договорённости о категориях - людям.
Кажется, что разметить обратную связь пользователей - это одна задача и один ИИ-агент. На практике проигрыш там, где одну модель просят одновременно понять смысл комментария, ничего не потерять и соблюсти общие правила. Команда Авито Рекламы решила это не новой моделью, а разделением ролей: несколько специализированных агентов, Python-помощник и обновляемая таксономия разметки.
Самый дорогой и самый ненадёжный способ разобрать обратную связь клиентов: отдать её одной большой модели «на подумать». Команда Авито Рекламы поступила наоборот. Она собрала конвейер из специализированных ИИ-агентов, Python-помощника и обновляемой таксономии. У каждого инструмента в нём своя роль, а не общая ответственность за результат.
Инструкция применима, если вы уже собираете обратную связь и не успеваете её читать: отзывы на маркетплейсе, оценки после заказа, обращения в поддержку, комментарии в соцсетях. Признаки, что пора: разбор отзывов съедает несколько часов в неделю, ответы на однотипные жалобы пишутся заново, а решения о продукте принимаются по последним десяти сообщениям, а не по всей массе. Поток должен быть хотя бы в несколько сотен однотипных текстов на русском в месяц — на десятке комментариев конвейер не окупится. Разбор опирается на опыт команды Авито Рекламы: связка из специализированных ИИ-агентов, Python-помощника и обновляемой таксономии (Habr, «Как мы собрали ИИ-конвейер для разметки продуктового фидбэка»). Ниже — как перенести схему на свой поток.
Более 260 приложений в проде, 150 авторов — и ни один программист не открыл исходники ни одного из них. Формально это описание аварии, а не достижения. Flowwow работает так уже четыре месяца. Здесь прячется самый полезный для малого бизнеса вопрос: что делать, когда код писать умеет ИИ-агент, а проверять его по-прежнему дорого и медленно.
Гендиректор RUTUBE Сергей Иванов заявил на Московском стартап-саммите: платформа будет адаптировать ролики под персональных ИИ-агентов. Борьба за внимание аудитории переходит в нейросети.
Инструкция пригодится, если клиенты приходят «подготовленными»: называют конкурентов, сравнивают прайсы, ссылаются на чужой обзор. Метод работает в любой нише со спросом по запросам «лучшие», «топ», «сравнение» — услуги, подрядчики, поставщики, локальный сервис. За рабочий день вы получаете карту: откуда ИИ берёт рекомендации, где вас в этих источниках нет и что править.
Инструкция применима, если вы запускаете ИИ-сервис под конкретную задачу компании: разбор заявок, подготовку коммерческих предложений, ответы клиентам, ведение контента. Она нужна, если вы понимаете: выбор модели не закрывает вопрос целиком. Модель генерирует текст, но не решает, откуда берёт сведения о ценах, кто имеет к ней доступ и что будет при сбое внешнего сервиса. Она не отвечает и за стоимость прогона. Всё это — обвязка (harness): интерфейс, API, передача контекста и корпоративных данных, разграничение доступа, логирование и обработка ошибок. Разбор — для собственника или руководителя, который ставит задачу подрядчику или собирает сервис с командой, а не для ML-инженера.
Сэм Альтман: OpenAI не выйдет на биржу, пока не сможет надёжнее гарантировать безопасность новых моделей.