Повернутися до часової лінії

Дослідження · 9 липня 2026 р.

Мультиагентна гра проти галюцинацій хімічної моделі

9 липня 2026 року дослідники Даляньського технологічного університету й Гонконгського університету науки і техніки виклали препринт про G-Frame — мультиагентну рамку на основі командних і баєсових ігор, яку використали, щоб очистити корпус хімічних текстів на 5 мільярдів токенів і синтезувати 363 045 ланцюжків міркувань та 199 589 пар «питання-відповідь». На цих даних навчено модель OmniChem (7 мільярдів параметрів), яка на тестах ThChem і ChemBench показала результати, порівнянні з GPT-4o mini й близькі до GPT-o3, а тест ChemJudge зафіксував зниження частоти фактичних помилок на 79,46 % відносно базової архітектури.

Чому це важливо

Робота пропонує спосіб тренувати малу спеціалізовану модель так, щоб зменшити її схильність вигадувати факти в дисципліні з жорсткими аксіоматичними правилами, — не через більший розмір моделі чи ручну розмітку, а через автоматизований замкнений цикл, де кілька агентів моделі самі генерують і перевіряють дані одне для одного за правилами теорії ігор. Авторський тест засвідчує зниження вигаданих фактів у власній перевірці; незалежного відтворення на день цього запису немає.

Препринт: arXiv:2607.08403v1, поданий 9 липня 2026 року, десять авторів з афіліаціями Даляньського технологічного університету та Гонконгського університету науки і техніки (і один незалежний дослідник). Версія станом на день цього запису — єдина (v1). G-Frame поєднує два механізми: кооперативну «командну гру» на мікрорівні, що структурно обмежує накопичення ентропії в авторегресивній генерації, розкладаючи макрозавдання на дрібні підзадачі з окремими агентами-виконавцями; і «баєсову гру» на макрорівні, що адаптивно оптимізує стратегії прийняття рішень в умовах невизначеності на довгих ланцюжках міркувань. Разом вони утворюють замкнений цикл автоматизованого синтезу даних і навчання. Рамку застосували, щоб очистити корпус безперервного попереднього навчання на 5 мільярдів токенів хімічних текстів і синтезувати спеціалізований корпус: 363 045 ланцюжків міркувань і 199 589 пар «питання-відповідь». На цих даних навчено модель OmniChem (7 мільярдів параметрів). На тестах ThChem і власному ChemBench модель показала результати, порівнянні з GPT-4o mini й близькі до GPT-o3; тест ChemJudge зафіксував зниження частоти фактичних помилок на 79,46 % відносно базової архітектури до навчання. Автори також демонструють застосування OmniChem у молекулярному дизайні, плануванні ретросинтезу й побудові графів знань. Чого запис не стверджує. Що метод узагальнюється на мовні моделі поза хімією: попри назву статті («Language Model Hallucination»), і рамка, і модель побудовані й перевірені виключно на хімічному матеріалі. Що 79,46 % — незалежно перевірене число: це результат авторського тесту ChemJudge, прочитаний з анотації препринта, а не з відтворення сторонньою стороною. Що роботу рецензовано чи використано в іншому випуску: станом на день запису відома лише перша версія препринта.

Відомості про подію

Дата події
9 липня 2026 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 28 вересня 2026 р.
Лінії
ID
evt-0906

Джерела

Пов’язані події

Передумови цієї події ще досліджуються.