.NET спільнота

RSS
206 статей, 196 топіків, 8K коментарів, 1039 учасників


← Сtrl 1... 7891011...14 Ctrl →

Коментарі

Перше питання — чому, при включеній українській мові в телеграм, бот почав спілкуватись зі мною російською? Мову я перемкнув, але перше враження дещо підпорчене. Сам бот спробую, може буде користь. Дякую.
Автор обійшов мовчанням ключовий момент: що в результаті? а саме: Q1-Система запрацювала в продакшені? Q2-Що по багам і юзер експірієнсу? Q3-Як воно працює на нестабільному інтернет-каналі?
наняли б индусов на апворке они б вам все переписали на дотнет за $1-2/час, дешевле чем ваши модели, потом отрефакторили б моделями
Хороша стаття, детальний опис вирішення проблем з готовими підходами. По моєму досвіду, при закидуванні легасі проекту у ЛЛМ, вона одразу починає писати про купу спеціфічних малих проблем, замість важливих речей. Контекст забивається.
аналогічно). чотири роки щодня працював із структурою і форматуванням юридичних документів. і станом на півроку тому парсери все іще смокчуть пісю і відновити структуру скільки-небудь нетривіального пдф-а не можуть.
IMHO, один з найгірших форматів для дата екстракшн.
PDF створювався як мова опису векторних сторінок та тексту, а не як набір «безтекстових гліфів». і для цього юзаються гліфи і це не символи як такі в стандатрі Unicode то ж, як вам правильно зауважили, тексту у звичайному розумінні там немає.
PDF створювався як мова опису векторних сторінок та тексту, а не як набір «безтекстових гліфів». Юридичний паплайн це одне з найскладніших у впровадженні, але це більше як окемий випадок.
це сортування виконуєтсья на попередніх кроках конвеєра: є метадата — у парсер, немає — у AI OCR.
А ви ніколи не бачили пдф-ів, в яких жодного текста, самі картинки текста?
Ctrl+A та прискіпливий погляд на сторінку, щоб ненароком не роздрукувати на «білому» аркуші те, що написане білим кольром, додане колегами за для потіхи хД Був же той час колись...))
з якого дива пдф має містити якийсь текст? немає такої вимоги, в документі можуть бути тільки гліфи. і так, це буде валідний стандартний пдф документ.
Витягувати OCRом те, що і так є в документі виглядає як дивна надбудова. Можливо для художніх текстів це допустимо, але наприклад, для юридичних, де одна погано розпізнана літера перевертає сенс документа — це неприпустимий ризик.
цікаво, дякую
тут скоріше питання не в тому що екстрактор не може, а в тому що не всі це враховують