← Все гайды · Контент-завод
Гайд · кодовое слово ЛЕКЦИЯ
Одна мысль из первой лекции Стэнфорда - и запросы пишутся иначе
Курс Stanford CS329A «Самообучающиеся ИИ-агенты» лежит в открытом доступе: девять лекций,
без оплаты и регистрации. Я вытащил субтитры первой и разобрал её. Из 69 минут забираю
одну мысль - ту, после которой стал по-другому спрашивать нейросеть.
МЫСЛЬ (лекция 1, таймкод 23:24)
Дословно лектора: «Похоже, модели знают куда больше, чем отдают,
когда спрашиваешь их один раз».
ОТКУДА ОНА ВЗЯЛАСЬ (прогон с лекции)
Одну и ту же задачу давали модели не один раз, а десять тысяч.
Маленькая модель Llama 8B с ОДНОЙ попытки слабее большой GPT-4o.
С многими попытками - обгоняет её. На всех задачах, что показали.
Параметры модели при этом не трогали вообще: менялся только способ спрашивать.
⚠️ ГРАНИЦА, КОТОРУЮ ГОВОРЯТ ТАМ ЖЕ
Приём работает ТОЛЬКО если есть чем отобрать правильный ответ
(на лекции это называют верификатором, таймкод 21:01). Без признака отбора
много вариантов - это просто много мусора.
И попаданий немного: из десяти тысяч решений верными бывали три-четыре.
ПРИЁМ ДЛЯ ОБЫЧНОГО ЗАПРОСА
Не бери первый ответ. Проси несколько - и СРАЗУ говори, по какому
признаку выбрать. Вставляй как есть:
«Дай три разных варианта. После этого проверь их сам по признаку:
[чем меряем]. Оставь тот, что проходит, и скажи одной строкой,
почему остальные не прошли».
Признак в скобках - это и есть отбор из лекции. Меняй под задачу:
- письмо - «звучит по-человечески, без канцелярита»;
- смета - «сходится сумма»;
- описание товара - «влезает в 1000 знаков»;
- письмо в организацию - «есть дата, суть и что я прошу сделать».
КОНСПЕКТ ЛЕКЦИИ 1 ПО ЭПИЗОДАМ (69 минут)
2:00 Законы масштабирования: больше параметров, данных и вычислений -
модель предсказуемо умнее.
7:00 Chain of thought: покажи модели ХОД решения, а не только ответ -
она начинает рассуждать шагами.
12:00 Как собрали ЧатГПТ: предсказание слова, дообучение, вопрос-ответ,
оценки живых людей.
20:00 Тот самый эпизод про много попыток - разобран выше.
28:00 DeepSeek и o1: модель учится на своих же удачных решениях.
33:00 Как думает o1: разбор, шаги, самопроверка, откат назад.
41:00 Чатбот против агента: один отвечает, второй доделывает.
45:00 Из чего собирают агентов: цепочки, роутинг, судья, проверяльщики.
50:00 Узкое место - проверка. Где ответ проверяем (код, математика),
там модель растёт почти без предела.
54:00 Где агенты уже зарабатывают: миграции кода, поддержка, исследования.
Последние 10 минут - домашки для студентов, можно мимо.
ГДЕ САМА ЛЕКЦИЯ
Рядом по теме
Что дальше
Этот разбор - выжимка моего прогона: субтитры вытащены, цитаты сверены
по таймкодам. Что из инструментов реально приживается у меня в работе день за днём -
пишу в телеграм-дневнике: t.me/sergeiai90.