Перше питання — чому, при включеній українській мові в телеграм, бот почав спілкуватись зі мною російською? Мову я перемкнув, але перше враження дещо підпорчене. Сам бот спробую, може буде користь. Дякую.
Автор обійшов мовчанням ключовий момент: що в результаті? а саме: Q1-Система запрацювала в продакшені? Q2-Що по багам і юзер експірієнсу? Q3-Як воно працює на нестабільному інтернет-каналі?
Хороша стаття, детальний опис вирішення проблем з готовими підходами.
По моєму досвіду, при закидуванні легасі проекту у ЛЛМ, вона одразу починає писати про купу спеціфічних малих проблем, замість важливих речей. Контекст забивається.
аналогічно). чотири роки щодня працював із структурою і форматуванням юридичних документів. і станом на півроку тому парсери все іще смокчуть пісю і відновити структуру скільки-небудь нетривіального пдф-а не можуть.
PDF створювався як мова опису векторних сторінок та тексту, а не як набір «безтекстових гліфів». і для цього юзаються гліфи і це не символи як такі в стандатрі Unicode то ж, як вам правильно зауважили, тексту у звичайному розумінні там немає.
PDF створювався як мова опису векторних сторінок та тексту, а не як набір «безтекстових гліфів». Юридичний паплайн це одне з найскладніших у впровадженні, але це більше як окемий випадок.
Ctrl+A та прискіпливий погляд на сторінку, щоб ненароком не роздрукувати на «білому» аркуші те, що написане білим кольром, додане колегами за для потіхи хД Був же той час колись...))
Витягувати OCRом те, що і так є в документі виглядає як дивна надбудова. Можливо для художніх текстів це допустимо, але наприклад, для юридичних, де одна погано розпізнана літера перевертає сенс документа — це неприпустимий ризик.
Коментарі