Автор обійшов мовчанням ключовий момент: що в результаті? а саме: Q1-Система запрацювала в продакшені? Q2-Що по багам і юзер експірієнсу? Q3-Як воно працює на нестабільному інтернет-каналі?
Хороша стаття, детальний опис вирішення проблем з готовими підходами.
По моєму досвіду, при закидуванні легасі проекту у ЛЛМ, вона одразу починає писати про купу спеціфічних малих проблем, замість важливих речей. Контекст забивається.
аналогічно). чотири роки щодня працював із структурою і форматуванням юридичних документів. і станом на півроку тому парсери все іще смокчуть пісю і відновити структуру скільки-небудь нетривіального пдф-а не можуть.
PDF створювався як мова опису векторних сторінок та тексту, а не як набір «безтекстових гліфів». і для цього юзаються гліфи і це не символи як такі в стандатрі Unicode то ж, як вам правильно зауважили, тексту у звичайному розумінні там немає.
PDF створювався як мова опису векторних сторінок та тексту, а не як набір «безтекстових гліфів». Юридичний паплайн це одне з найскладніших у впровадженні, але це більше як окемий випадок.
Ctrl+A та прискіпливий погляд на сторінку, щоб ненароком не роздрукувати на «білому» аркуші те, що написане білим кольром, додане колегами за для потіхи хД Був же той час колись...))
Витягувати OCRом те, що і так є в документі виглядає як дивна надбудова. Можливо для художніх текстів це допустимо, але наприклад, для юридичних, де одна погано розпізнана літера перевертає сенс документа — це неприпустимий ризик.
я просто на початку документу пишу промт-іньекцію а потім її перекриваю блоком с заливкою як і фон а вже потім іде рендерінг всього іншого
це безпечніше в тому сенсі що виділення курсом по документу не скопіюе випадково промт
і ще з практики — текст...
Коментарі