i
ДАТАИСТ
К ленте

Практика работы с моделями

Как выжимать из модели больше: промптинг, выбор режима, типичные ошибки в использовании.

7 материалов

Новая погодная ИИ-модель Google: забыть зонт больше не оправдание

Google DeepMind и Google Research выпустили WeatherNext 3 — новую модель ИИ для прогнозирования погоды. Она точнее отслеживает изменения в атмосфере, строит прогнозы с разрешением до 5 км, улучшила оценку дождя на 60% по сравнению с WeatherNext 2 и формирует данные каждый час вместо одного раза в шесть часов. Google планирует использовать модель в погодной информации Поиска, Google Maps и Gemini, а также открыть её пользователям и исследователям через облачные платформы. На бенчмарке Operational WeatherBench WeatherNext 3 обошла другие модели ИИ и традиционные прогнозы.

Почему каждому студенту нужен ИИ-репетитор

Хороший ИИ-репетитор — это не тот, кто просто много знает, а тот, кто понимает, как именно учить именно вас. Авторы предлагают способ делать для каждого ученика его цифрового двойника: такую модель, которая не только похожа на его обычные ответы, но и правдоподобно меняется после подсказки, объяснения или исправления. Это помогает заранее проверять, какой стиль помощи лучше сработает для конкретного человека, не тратя время на долгие и дорогие пробы на живых студентах. В этом обзоре разбираем, как создают таких цифровых учеников, зачем они нужны ИИ-репетиторам и почему без личной подстройки обучение быстро упирается в потолок.

ИИ-персоны исследуют психологическую основу шкалы осознанности Лангера

Генеративный ИИ и большие языковые модели могут использоваться как виртуальные участники психологических экспериментов. В мини-исследовании 1 000 разнообразных ИИ-персон прошли шкалу осознанности Лангера (LMS), и их результаты оказались смещены к средним и высоким значениям, а не распределились равномерно. Вероятной причиной автор считает скрытое влияние обучения с подкреплением на основе обратной связи от людей (RLHF): во время настройки моделей люди обычно положительно оценивают любознательность и гибкость. Это показывает, что ИИ-персон для психологических исследований нужно создавать особенно тщательно, иначе результаты окажутся искажены.

Автоматическая отладка улучшила ИИ-агентов на 10%

ИИ-агенты часто проваливают длинные задачи не из-за одной большой ошибки, а потому что мелкие сбои постепенно накапливаются. Авторы предлагают способ автоматически улучшать всё, что окружает агента: подсказки, инструменты и правила управления его действиями. Система изучает следы неудачных попыток, находит причину сбоя, вносит точечные изменения и проверяет, действительно ли они помогают. Такой подход избавляет разработчиков от долгого ручного поиска настроек и делает агентов надёжнее в сложных задачах. В этом обзоре разбираем, как автоматическая отладка помогает ИИ-агентам справляться с длинными цепочками действий и почему одних общих советов об ошибках для этого недостаточно.

Как миллионы виртуальных пользователей помогают заменить дорогие тесты на людях

Можно ли проверять ИИ и цифровые сервисы на миллионах «людей», не собирая каждый раз дорогие и долгие отзывы у живых пользователей? Исследователи предлагают большую систему с виртуальными пользователями, у каждого из которых свой характер, привычки, терпение и реакции. Эти пользователи могут отвечать на вопросы, общаться с ИИ-помощником, пользоваться сайтом или приложением и показывать, где человек уйдёт, где засомневается, а где простит ошибку. Такой подход помогает увидеть не среднюю температуру по больнице, а то, как один и тот же продукт воспринимают очень разные люди. В этом обзоре разбираем, как устроена такая проверка на виртуальных пользователях, откуда берутся их профили и насколько их поведение похоже на поведение реальных людей.

Ваша LLM умнее, чем кажется — вы просто используете ее неправильно

Когда важен не только мозг, но и «обвязка» вокруг него. Как Meta-Harness автоматизирует создание harness для LLM. В разговорах об ИИ мы почти всегда обсуждаем сами LLM: размер, качество данных, архитектуру и скорость. Но в реальных приложениях на итоговую полезность влияет ещё один слой — harness. Это кодовая «обвязка» вокруг модели, которая…

Инженирия контекста для саморазвивающихся ИИ-агентов

За последние два года стало ясно: многие приложения на базе больших языковых моделей лучше учатся не через дообучение весов, а через заботливую работу с контекстом. В контекст мы кладем системные инструкции, шаги рассуждений, примеры, доменные правила, факты, даже подсказки по работе с…