DeepSeek AI представила новую методику моделирования вознаграждений для языковых моделей
Исследовательская лаборатория DeepSeek AI из Китая, известная своими мощными открытыми языковыми моделями, такими как DeepSeek-R1, представила значительное усовершенствование в области моделирования вознаграждений для больших языковых моделей (LLMs). Новая техника, получившая название Self-Principled Critique Tuning (SPCT), направлена на создание универсальных и…
