Может ли ИИ проектировать печатные платы? EEBench проверяет на практике

· Искусственный интеллект
Бенчмарк EEBench от создателей atopile оценивает, насколько современные модели справляются с реальными задачами схемотехники. Первое место — у Claude Opus 5 с результатом 61,6%.

cover.svg

Команда, стоящая за инструментом atopile, запустила бенчмарк EEBench, чтобы ответить на неожиданно сложный вопрос: способен ли искусственный интеллект проектировать электронные схемы — и как вообще измерить, хороши ли получившиеся платы. Поводом послужила демонстрация GPT-6 Astra, работающего с платой в KiCad, которую OpenAI вынесла на первую страницу анонса.

Код вместо кликов мышью

Авторы отмечают, что модели знают об электронике куда больше, чем показывают в графических CAD-редакторах. Управляя визуальным интерфейсом, агент тратит большую часть контекста на координаты, меню и состояние приложения. Поэтому EEBench использует atopile, где схема описывается декларативным кодом: агент напрямую работает с компонентами, связями и электрическими ограничениями, может пересобрать проект, запустить симуляцию и разобрать, что именно не сработало.

Реальный мир не прощает идеализаций

Одна из публичных задач построена на бытовом счётчике электроэнергии: при пропадании питания 5 В схема должна ещё 20 мс удерживать процессор выше порога отключения 3,0 В, чтобы тот успел сохранить показания. Почти все модели интуитивно приходят к верному решению — добавить конденсатор. Но настоящий керамический конденсатор под напряжением отдаёт заметно меньше заявленной ёмкости, у деталей есть допуски, а лишняя ёмкость стоит денег и замедляет восстановление. Схема, работающая на номинальных значениях, может отказать на реальных компонентах.

EEBench моделирует обрыв питания и измеряет напряжение на протяжении всего провала, эффективную ёмкость в рабочей точке, восстановление и соблюдение ограничений по корпусу, диэлектрику и цене. Более сложные аналоговые задачи требуют, например, синтезировать фильтр нижних частот на операционном усилителе и удержать усиление, частоту среза и добротность в допусках при худших сочетаниях параметров. Все проверки детерминированы: система строит граф схемы и спецификацию, гоняет SPICE-симуляции и сверяет каждое измерение с пределом. Ключевой момент — использование реальных компонентов от производителей, которые должны существовать, поддаваться заказу и укладываться в бюджет. Именно к этому компромиссу между характеристиками, ценой и доступностью, по мнению авторов, и сводится инженерное дело.

Что показывает таблица лидеров

Результаты на 1 сентября авторы называют обнадёживающими. Из 13 задач EEBench V1 лидирует Claude Opus 5 с 61,6%, за ним Grok 4.6 (57,1%) и Claude Fable 5.1 (56,4%). Модели OpenAI пока ниже: GPT-5.5 набрал 42,3%, GPT-5.6 Sol — 39,4%, а результата GPT-6 Astra ещё нет. Показательно, что xAI включила EEBench в модельную карту Grok 4.6.

Бенчмарк одновременно служит средой для обучения с подкреплением: провалившийся прогон подсказывает, какое напряжение вышло за предел и не оказалось ли решение излишне дорогим. Так может ли ИИ проектировать платы? Для растущего набора задач — уже да, заключают авторы, хотя доверить ему разработку кардиостимулятора вслепую пока не стоит.


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.