EvoliqLabs
Již brzy

Výzkumný náhled

Unflatten W

Z PDF a obrazů dokumentů do editovatelného DOCX

Unflatten W je výzkumný model dokumentové inteligence zaměřený na věrnou rekonstrukci strukturovaných dokumentů Word. Cílem je porozumět viditelnému rozvržení, struktuře a obsahu dokumentu a následně je znovu sestavit jako čistý, editovatelný DOCX.

Výzkumný vývojReálné dokumentyStrukturovaný výstup

Unflatten W

Již brzy
  1. PDF / obrazy dokumentů

  2. Canonical AST

    Strukturovaná reprezentace dokumentu

  3. Editovatelný DOCX

PDF / obrazy dokumentů

Skeny, zprávy, smlouvy a formuláře

Editovatelný DOCX

Strukturovaný, editovatelný a připravený k renderování

  • Analýza rozvržení
  • Rekonstrukce struktury
  • Zarovnání obsahu
  • Typované vlastnosti

Představujeme rodinu Unflatten

Unflatten je výzkumná rodina modelů dokumentové inteligence zaměřená na převod složitých souborů do editovatelných strukturovaných výstupů. Jednotlivé modely cílí na různé kancelářské formáty, ale sdílejí společný základ pro porozumění rozvržení, strukturované dekódování a věrnou rekonstrukci.

Prozkoumat Evoliq Labs
Již brzy

Unflatten W

PDF / obrazy dokumentů → editovatelný DOCX

Již brzy

Unflatten X

Dokumenty a tabulky → strukturovaný tabulkový výstup

Již brzy

Unflatten P

Snímky a vizuální rozvržení → editovatelná struktura prezentace

Již brzy

Sdílený základ

Porozumění rozvržení, strukturované dekódování a výzkum modelů

Co má Unflatten W umět

Již brzy

Rekonstrukce rozvržení

Odstavce, nadpisy, seznamy, sekce a vícesloupcová struktura dokumentu.

Rekonstrukce tabulek

Tabulky s velkým množstvím údajů, sloučené buňky, buňky přes více řádků či sloupců a obnova tabulkové struktury.

Obrázky a zdroje

Vložené obrázky, související soubory a obnova obrazových zdrojů dokumentu.

Architektura Dense a MoE

V budoucím výzkumu chceme zkoumat dense architektury a varianty Mixture-of-Experts (MoE) se společným jádrem pro práci s dokumenty.

Již brzy

Rodina modelů Unflatten

Jedna výzkumná linie pro editovatelnou rekonstrukci Office dokumentů: Word, tabulky a prezentace se sdíleným základem porozumění dokumentům.

Rodina modelů Unflatten se společným základem pro porozumění dokumentům: W rekonstruuje PDF a obrázky dokumentů do editovatelného DOCX, X dokumenty a tabulky do tabulkových souborů a P snímky a vizuální rozvržení do prezentací.
Již brzy

Technické shrnutí

Aktuální architektura Unflatten W odděluje naučenou rekonstrukci dokumentu od deterministického skládání a renderování. Model predikuje strukturu dokumentu, viditelný text a typované vlastnosti; deterministické komponenty validovaný výstup povýší do Canonical AST a vyrenderují jej do DOCX.

  • Canonical AST
  • Qwen3-VL backbone
  • Strukturované dekódování
  • DOCX renderer
  • Výzkumný náhled
  1. Obrazové body

    Vstup: PDF / obrázek

  2. Model

    Qwen3-VL + větev pro rekonstrukci dokumentů

  3. Ověřená reprezentace

    Canonical AST → deterministický renderer DOCX

Stav výzkumu

Již brzy

Unflatten W i širší rodina Unflatten jsou v aktivním vývoji v Evoliq Labs. Tato stránka je veřejný výzkumný náhled, nikoli oznámení produkční dostupnosti.

Unflatten W — výzkumný náhled dokumentové inteligence | Evoliq Labs