Toolmap / фільми / Що асистент бачить у договорі

Що асистент бачить у договорі

Чернетка. Текст і кадри ще вичитуються і можуть змінитися.

Асистент читає не файл, а текст, який із цього файла дістала програма.

Фільм · близько 4 хв зі звуком · практикум «Договір як дані»

Спершу варто подивитись:

Гортай далі

    Текстом

    Те саме, що у фільмах: кожен кадр і його текст. Текст можна скопіювати і дати своєму асистентові разом із власним питанням.

    Що асистент бачить у договорі

    1. Договір поставки надходить файлом, і людина додає його до розмови з асистентом, щоб той оцінив умови. Сучасний асистент читає договір цілком, проте читає він не сам файл, а текст, який із файла дістали. Фільм показує, яким цей текст виходить із файла Word, із PDF і зі скану, що в нього не потрапляє і як за хвилину переконатися, що асистент прочитав саме той договір.

    2. Текст із файла дістає не модель. Мовна модель, яка складає відповіді, приймає тільки текст, тому продукт, тобто програма, в якій працює асистент, спершу розгортає файл: відкриває його і виписує вміст рядок за рядком. Сторінку такою, як її бачить людина, модель здебільшого не отримує. Що саме вдасться виписати, залежить від формату, тож той самий договір у трьох форматах дає три різні тексти.

    3. Найповніший текст виходить із файла Word, бо він і всередині є текстом із розміткою: редактор позначає в ньому, де заголовок розділу, де нумерований пункт, де клітинка таблиці. Програма переносить це без втрат, і модель отримує розділи в тому самому порядку і з тими самими номерами. Пункт 3.1 про аванс 120 000,00 грн протягом 5 банківських днів доходить до неї слово в слово.

    4. Проте у файлі Word лежить більше, ніж видно на сторінці. Після роботи в режимі виправлень редактор зберігає в ньому видалений текст і коментарі на полях: тут у пункті 3.1 строк 10 днів замінили на 5 і запитали, чи не забагато 40 %. Одні продукти передають моделі лише остаточний текст, інші додають видалене й коментарі, тож в пункті стоять два строки поруч. Тому правки перед завантаженням приймають або відхиляють.

    5. У PDF розмітки вже немає: такий файл зберігає кожен шматок тексту разом із його місцем на аркуші, але не позначає, де абзац і де клітинка таблиці. Програма збирає рядки за координатами, і суцільний текст виходить добре. Таблицю ж вона може прочитати стовпцями, і тоді суми стоять окремо від слів «аванс» і «залишок». Котру суму до якого рядка віднести, модель вирішує сама і в складній таблиці може помилитися.

    6. Скан теж часто зберігають як PDF, але всередині немає жодної літери, тільки знімок аркуша. Літери на ньому впізнає програма розпізнавання тексту, а в деяких продуктах сама модель, якщо вона вміє читати зображення. Схожі знаки при цьому плутаються, найчастіше цифри: під печаткою програма прочитала 180 000,00 як 130 000,00. Розпізнаний текст такий самий рівний, як текст із Word, і помилки в ньому не видно.

    7. Частина договору в текст не потрапляє за жодного формату. Печатка й підпис є зображеннями, тому з тексту не видно, чи договір підписано. Пункт 1.2 згадує Додаток 1 зі специфікацією, але файла з ним не додали. Дуже довгий документ продукт може передати не цілим. Про ці прогалини модель повідомляє не завжди: відповідь вона складає з того тексту, який має, і звучить та так само впевнено.

    8. Що саме дійшло до моделі, зʼясовують до аналізу, двома проханнями: перелічити розділи з номерами і згадані в тексті додатки та дослівно процитувати один пункт із цифрами, наприклад 3.1. Відповідь звіряють із файлом: девʼять розділів на місці, цитата збігається до знака, а про Додаток 1 асистент пише, що файла з ним немає. Коли розділу бракує або цифра інша, спершу виправляють файл, а не запит.

    Далі