Олексію, дякую за коментар! У нашому випадку виключень не було, логіка не була зав’язана на полі reasoning, тому його можна було безпечно прибрати. Там, де модель дійсно потребувала reasoning ми підбирали відповідні параметри LLM. Щодо статистичної оцінки, так для всіх промптів ми робимо оцінку якості, зокрема і для задач парсингу. Для кожного промпта формуємо набір даних і підбираємо метрики, що найкраще відображають якість конкретної задачі (як стандартні метрики з досліджень, так і кастомні під задачу). На додаток до цього нові зміни, у тому числі й прибирання reasoning, релізимо через A/B тести й порівнюємо метрики до і після.
Олексію, дякую за коментар!
У нашому випадку виключень не було, логіка не була зав’язана на полі reasoning, тому його можна було безпечно прибрати. Там, де модель дійсно потребувала reasoning ми підбирали відповідні параметри LLM.
Щодо статистичної оцінки, так для всіх промптів ми робимо оцінку якості, зокрема і для задач парсингу. Для кожного промпта формуємо набір даних і підбираємо метрики, що найкраще відображають якість конкретної задачі (як стандартні метрики з досліджень, так і кастомні під задачу). На додаток до цього нові зміни, у тому числі й прибирання reasoning, релізимо через A/B тести й порівнюємо метрики до і після.