← Все гайды · Контент-завод

Гайд · кодовое слово ЛЕКЦИЯ

Одна мысль из первой лекции Стэнфорда - и запросы пишутся иначе

Курс Stanford CS329A «Самообучающиеся ИИ-агенты» лежит в открытом доступе: девять лекций, без оплаты и регистрации. Я вытащил субтитры первой и разобрал её. Из 69 минут забираю одну мысль - ту, после которой стал по-другому спрашивать нейросеть.

МЫСЛЬ (лекция 1, таймкод 23:24)

Дословно лектора: «Похоже, модели знают куда больше, чем отдают,
когда спрашиваешь их один раз».

ОТКУДА ОНА ВЗЯЛАСЬ (прогон с лекции)

Одну и ту же задачу давали модели не один раз, а десять тысяч.
Маленькая модель Llama 8B с ОДНОЙ попытки слабее большой GPT-4o.
С многими попытками - обгоняет её. На всех задачах, что показали.
Параметры модели при этом не трогали вообще: менялся только способ спрашивать.

⚠️ ГРАНИЦА, КОТОРУЮ ГОВОРЯТ ТАМ ЖЕ

Приём работает ТОЛЬКО если есть чем отобрать правильный ответ
(на лекции это называют верификатором, таймкод 21:01). Без признака отбора
много вариантов - это просто много мусора.
И попаданий немного: из десяти тысяч решений верными бывали три-четыре.

ПРИЁМ ДЛЯ ОБЫЧНОГО ЗАПРОСА

Не бери первый ответ. Проси несколько - и СРАЗУ говори, по какому
признаку выбрать. Вставляй как есть:
«Дай три разных варианта. После этого проверь их сам по признаку:
[чем меряем]. Оставь тот, что проходит, и скажи одной строкой,
почему остальные не прошли».
Признак в скобках - это и есть отбор из лекции. Меняй под задачу:
- письмо - «звучит по-человечески, без канцелярита»;
- смета - «сходится сумма»;
- описание товара - «влезает в 1000 знаков»;
- письмо в организацию - «есть дата, суть и что я прошу сделать».

КОНСПЕКТ ЛЕКЦИИ 1 ПО ЭПИЗОДАМ (69 минут)

2:00 Законы масштабирования: больше параметров, данных и вычислений -
модель предсказуемо умнее.
7:00 Chain of thought: покажи модели ХОД решения, а не только ответ -
она начинает рассуждать шагами.
12:00 Как собрали ЧатГПТ: предсказание слова, дообучение, вопрос-ответ,
оценки живых людей.
20:00 Тот самый эпизод про много попыток - разобран выше.
28:00 DeepSeek и o1: модель учится на своих же удачных решениях.
33:00 Как думает o1: разбор, шаги, самопроверка, откат назад.
41:00 Чатбот против агента: один отвечает, второй доделывает.
45:00 Из чего собирают агентов: цепочки, роутинг, судья, проверяльщики.
50:00 Узкое место - проверка. Где ответ проверяем (код, математика),
там модель растёт почти без предела.
54:00 Где агенты уже зарабатывают: миграции кода, поддержка, исследования.
Последние 10 минут - домашки для студентов, можно мимо.

ГДЕ САМА ЛЕКЦИЯ

Плейлист курса, 9 лекций:
youtube.com/playlist?list=PLangBM27OtEA
Сайт курса со слайдами: cs329a.stanford.edu
Смотреть по-русски: включи субтитры в плеере и выбери русские -
или скинь ссылку Клоду и попроси конспект с таймкодами.

Рядом по теме

Смежный гайд: СТЭНФОРД - весь курс и как смотреть по-русски

Что дальше

Этот разбор - выжимка моего прогона: субтитры вытащены, цитаты сверены по таймкодам. Что из инструментов реально приживается у меня в работе день за днём - пишу в телеграм-дневнике: t.me/sergeiai90.