Прогон фермы — это контролируемый период работы оборудования на нагрузке до ввода в постоянную эксплуатацию. Цель — выявить скрытые дефекты сборки, нестабильность питания, перегрев и ошибки конфигурации до того, как они приведут к простоям или порче железа. Цена пропуска этапа: потеря времени на отладку в продакшене, риск выхода из строя блоков питания, видеокарт или материнских плат под нагрузкой. Ожидаемый результат — ферма работает заданное время без ошибок, перезагрузок и критического перегрева при целевых настройках.
Ситуация типична: собрана новая ферма или заменены ключевые компоненты (БП, райзеры, видеокарты). Без прогона неизвестно, выдержит ли цепь питания пиковые токи, достаточно ли охлаждения при 100% загрузке, корректно ли настроены вольтажи и тайминги. Прогон также нужен после длительного простоя, переноса или обновления BIOS/драйверов.
Граница применимости: метод работает для ферм на GPU и ASIC с программным управлением вольтажами и частот. Не подходит для оборудования с закрытым прошивкой, где нельзя изменить параметры питания, и для стендов без мониторинга температур и потребления.
Подготовка к прогону: обязательные проверки до старта
Перед подачей питания на райзеры и видеокарты проверьте физическую сборку. Все контакты PCIe должны щёлкать, дополнительное питание 6/8-pin вставлено до упора, райзеры закреплены, вентиляторы вращаются свободно. Проверьте мультиметром отсутствие коротких замыканий на шинах 12В и земля на каждом райзере и видеокарте — это убережёт от сгоревших БП при первом включении.
Соберите минимальный программный стек: ОС (Windows/Linux/HiveOS/RaveOS), драйверы видеокарт, майнер с конфигом для тестового алгоритма, утилиты мониторинга (GPU-Z, HWInfo, nvidia-smi, amdgpu-top). Настройте автозапуск майнера и запись логов в файл. Отключите автоматическое обновление ОС и спящий режим.
Определите целевые настройки: core clock, memory clock, power limit, вольтаж (если доступен). Для прогона начните с консервативных значений: power limit 70–75% от номинала, штатные частоты без разгона. Это создаёт нагрузку, близкую к рабочей по току, но снижает тепловыделение и пиковые токи.
Этап 1: Холодный старт и проверка POST
Включите только блоки питания (без подачи сигнала включения на материнку) — проверьте вольтметром выходные напряжения БП на нагрузке (подключите нагрузку или включите материнку без видеокарт). 12В должны держаться в пределах ±5% от номинала. Если БП имеют регулятор напряжения — выставьте 12.1–12.2В для компенсации потерь на проводах.
Включите материнскую плату без видеокарт. Убедитесь, что BIOS видит все слоты PCIe (даже пустые), оперативку, накопители. Обновите BIOS до последней версии с поддержкой 4G Decoding, Above 4G Decoding, Re-Size BAR — это критично для стабильности множественных GPU.
Подключите одну видеокарту через райзер. Загрузитесь в ОС, проверьте определение в диспетчере устройств и GPU-Z. Запустите майнер на 1 карте 15 минут. Фиксируйте: температура ядра, память, хотспот, потребление (через ваттметр на входе БП или сенсоры БП), хэшрейт, rejected shares. Нет ошибок — подключайте следующую карту.
Пошаговый порядок подключения карт
- 01Подключить 1 карту, загрузить ОС, проверить определение в GPU-ZКонтроль: Видна 1 GPU, верный Device ID, нет ошибок Code 43
- 02Запустить майнер 15 мин на консервативных настройкахКонтроль: Температуры в норме, хэшрейт соответствует ожидаемому ±5%, rejected shares < 1%
- 03Добавить вторую карту, повторить проверку 15 минКонтроль: Обе карты стабильны, суммарное потребление не превышает 80% от номинала БП
- 04Повторить до полного комплекта, каждый шаг — 15 мин тестаКонтроль: Все GPU онлайн, суммарный хэшрейт линейно растёт, БП не перегружены
Этап 2: Прогон на сниженной нагрузке (70–80% power limit)
С полным комплектом карт запустите майнер на power limit 70–75% от номинала видеокарты. Длительность — 2–4 часа. Это основной этап выявления проблем с питанием: контакты райзеров, качество проводов, перегруз БП. Наблюдайте за потреблением на входе каждого БП ваттметром — оно не должно превышать 85–90% от номинальной мощности БП.
Контрольные точки каждые 30 минут: температуры ядра/памяти/хотспот каждой карты, скорость вентиляторов, потребление БП, хэшрейт, количество ошибок (stale/rejected/invalid shares). Записывайте в таблицу или логи. Любой дрейф температуры вверх >2°C за 30 минут при неизменных условиях — признак недостаточного охлаждения или запыления радиаторов.
Если ферма проходит 4 часа без перезагрузок, BSOD, зависаний майнеров, артефактов на экране (если есть монитор) и с rejected shares < 0.5% — переходите к следующему этапу. При любой нестабильности — фиксируйте симптом, останавливайте, диагностируйте (см. раздел диагностики).
Этап 3: Нарастание до целевых настроек
Поднимайте power limit на 5–10% каждые 1–2 часа до целевого значения. После каждого шага — 30 минут наблюдения. Параллельно можно аккуратно поднимать частоты памяти (на 50–100 МГц за шаг) с тестом на стабильность каждым шагом. Вольтаж (core voltage) меняйте только если есть опыт и понимание кривой V/f конкретной карты — ошибка здесь мгновенно убивает GPU.
На каждом шаге проверяйте: не превышает ли потребление БП 90% номинала, не уходит ли хотспот памяти выше 95–100°C (зависит от модели), не растёт ли rejected shares. Целевая настройка считается пройденной, если ферма работает 6–12 часов на 100% power limit и целевых частотах без ошибок.
Важно: хэшрейт на алгоритме может отличаться от калькуляторов на ±3–5% из-за лотереи блоков, версии майнера, драйверов. Ориентируйтесь на стабильность показателей во времени, а не на совпадение с онлайн-калькулятором.
Частые симптомы и вероятные причины
| Симптом | Причина | Что сделать |
|---|---|---|
| Перезагрузка фермы под нагрузкой | Перегруз блока питания по току или срабатывание OCP/OVP | Проверить ваттметром потребление каждого БП, снизить power limit, разнести карты по БП |
| Видеокарта исчезает из системы (Code 43) | Плохой контакт райзера, недостаток питания на 12V, неисправный PCIe-слот | Переустановить райзер, проверить 12V мультиметром под нагрузкой, переставить в другой слот |
| Рост rejected/invalid shares до >2% | Нестабильные тайминги памяти, перегрев VRAM, ошибки шины PCIe | Сбросить тайминги на штатные, улучшить охлаждение памяти, проверить качество райзера |
| Хотспот памяти >100°C при нормальной температуре ядра | Некачественный термопад/термопаста на памяти, плохой контакт платы с радиатором | Заменить термопады на толщину по даташиту, проверить прижим радиатора |
Этап 4: Длительный стресс-тест (24–48 часов)
После достижения целевых настроек запустите ферму на 24–48 часов непрерывно. Это выявляет проблемы, проявляющиеся только при нагреве корпуса, дрейфе частот БП, утечках памяти майнера, перегреве VRM зон материнской платы. Логируйте всё: температуры, потребление, хэшрейт, ошибки, аптайм майнера.
Контрольные точки: каждые 4 часа (или удалённо через мониторинг) проверяйте, что все GPU онлайн, хэшрейт не падает, rejected shares не накапливаются. Если используете HiveOS/RaveOS — настройте телеграм-алерты на отвал карты, перегрев, потерю соединения.
По итогам 24 часов: постройте графики температур и потребления. Они должны быть плоскими или с минимальным дрейфом. Резкие скачки потребления БП — признак старения конденсаторов или нестабильной работы PFC. Падение хэшрейта >2% от пика — признак троттлинга или ошибок памяти.
Мониторинг и логирование: что фиксировать обязательно
Минимальный набор метрик для каждого GPU: core temp, memory junction temp (hotspot), VRM temp (если есть сенсор), core clock, memory clock, power draw, fan speed, hashrate. Для БП: входное напряжение/ток/мощность (ваттметр), выходное напряжение 12V под нагрузкой. Для среды: температура входа/выхода воздуха фермы.
Формат логов: CSV или JSON с таймстампом. Пример строки: timestamp, gpu_id, core_temp, mem_temp, hotspot, core_clk, mem_clk, power, fan_pct, hashrate, accepted, rejected. Это позволяет пост-фактум найти корреляцию событий (скачок температуры → рост rejected).
Автоматизируйте сбор: скрипт на bash/Python, опрашивающий nvidia-smi / amdgpu-top / ipmi / SNMP БП каждые 30–60 секунд, пишущий в ротируемые файлы. Храните логи минимум 7 дней для анализа инцидентов.
Ключевые параметры для контроля
- Power limit старт
- 70–75% от номинала GPUЗависит от модели карты и качества БП
- Длительность этапа 70%
- 2–4 часаДо стабильных температур и 0 ошибок
- Шаг нарастания power limit
- 5–10% каждые 1–2 часаС обязательным 30-мин окном наблюдения
- Целевой стресс-тест
- 24–48 часов на 100% настроекБез перезагрузок, rejected < 0.5%
- Порог хотспот памяти
- < 95–100°C (по даташиту GPU)Превышение — троттлинг или деградация
- Загрузка БП
- ≤ 85–90% от номиналаИзмерять ваттметром на входе каждого БП
Границы и ограничения метода
Прогон не гарантирует отсутствие дефектов, проявляющихся через месяцы (электромиграция, высыхание термопасты, деградация конденсаторов). Он выявляет только «инфантильные» неисправности сборки и настройки.
Метод не работает, если: нет ваттметра на входе БП (слепое доверие к сенсорам GPU), нет доступа к хотспот-памяти (старые драйверы/прошивки), ферма в закрытом боксе без принудительной вентиляции (тепловой кумулятивный эффект), используются БП без запаса по току (например, серверные 1200W на 6×3080).
Опасное условие: если при прогоне БП издают свист/щелчки, пахнет паленой изоляцией, корпус БП горячий >60°C — немедленно отключайте. Это признаки перегрузки или неисправности БП, продолжение ведёт к пожару или каскадному выходу карт из строя.
Приёмка результата: чек-лист готовности к продакшену
Ферма считается пройденной, если выполнены все условия: 1) 24+ часов работы на целевых настройках без перезагрузок и зависаний майнеров. 2) Rejected/invalid shares < 0.5% от accepted за весь период. 3) Температуры всех зон (ядро, память, хотспот, VRM) стабильны ±2°C за последние 6 часов. 4) Потребление каждого БП не превышает 85% номинала и не дрейфует вверх. 5) Хэшрейт каждой карты в пределах ±3% от эталонного для данных настроек. 6) Логи полные, без пропусков интервалов.
Если какое-то условие не выполнено — ферма не готова. Вернитесь к этапу диагностики, устраните причину, повторите стресс-тест с момента изменения. Не запускайте в продакшн «на авось» — цена простоя на пуле и риск железа выше стоимости дополнительных часов прогона.
Признаки готового результата
- 24+ часов непрерывной работы на целевых настройках без перезагрузок
- Rejected/invalid shares < 0.5% за весь период теста
- Температуры всех зон стабильны ±2°C последние 6 часов
- Потребление каждого БП ≤ 85% номинала без дрейфа вверх
- Хэшрейт каждой карты в коридоре ±3% от эталонного
- Логи непрерывны, без пробелов и ошибок сбора
Что делать после прогона: переход в эксплуатацию
Сохраните итоговый конфиг (профиль разгона, настройки БП, версии драйверов/майнера) как «золотой образ». Настройте систему мониторинга с алертами: отвал GPU, температура > порога, rejected > 1%, потеря связи > 1 мин. Заведите журнал инцидентов — даже мелкие сбои в первые недели эксплуатации помогают выявить системные проблемы.
Планируйте ревизию через 2 недели: визуальный осмотр контактов, затяжка силовых разъёмов (термоусадка даёт усадку), проверка термопад на память (могут осесть), чистка пыльников. Повторный короткий прогон (2 часа) после любого вмешательства в железо обязателен.
Не меняйте настройки «на лету» в продакшене. Любое изменение power limit, частот, вольтажей — только через полный цикл прогона от этапа 70%. Это единственный способ сохранить предсказуемость и безопасность фермы.
Сколько времени точно нужен на полный прогон новой фермы?
Минимум 24–36 часов чистого времени: 2–4 часа на 70%, 6–12 часов на нарастание, 24 часа на целевых. С подготовкой, сбором, правкой ошибок — реально 2–3 дня. Не сжимайте этапы: пропуск этапа 70% часто приводит к сгоревшим БП на 100%.
Можно ли гонять ферму сразу на 100% power limit, если БП мощные?
Не рекомендуется. Даже с запасом БП 2x скрытые дефекты контактов райзеров, некачественная пайка шин на плате карты или ошибки в настройках таймингов проявятся мягче на 70%. Цена ошибки на 100% — сгоревшая карта или БП. Экономия 4–6 часов не стоит риска.
Что делать, если одна карта показывает хотспот 105°C, а остальные 90°C?
Это не норма. Остановите ферму. Проверьте термопад на памяти этой карты — скорее всего, неправильная толщина, отсутствие контакта или высыхание. Замените термопад на толщину по даташиту (обычно 1.0–2.0 мм), убедитесь в равномерном прижиме радиатора. Повторите прогон с этапа 70% для этой карты.
Нужен ли прогон после замены только термопад на памяти?
Да, обязателен короткий цикл: 1 час на 70%, 2 часа на 100%. Замена термопад меняет тепловое сопротивление, может выявить плохой контакт чипа с подложкой или дефект памяти, который был маскирован перегревом. Без прогона вы не узнаете, улучшилось ли или ухудшилось.
Как понять, что БП не тянет, если у него нет телеметрии?
Ваттметр на входе каждого БП — единственный надёжный способ. Измеряйте активную мощность под нагрузкой. Если она >85% номинала БП — БП перегружен. Косвенные признаки без ваттметра: свист дросселей, горячий корпус >55°C, падение 12V ниже 11.8В под нагрузкой (мультиметр на разъёме PCIe). Без измерений — вы гадаете.
Можно ли использовать фуримарк или OCCT вместо майнера для прогона?
Нет. Синтетические нагрузочные тесты создают другую нагрузку на цепи питания и память, не соответствующую майнингу. Майнер грузит память и шейдеры в соотношении, типичном для алгоритма (Ethash, Kawpow, Alephium и др.). Прогон должен быть на целевом алгоритме с целевым майнером. Синтетика даёт ложное чувство безопасности.