AI-extraktion vs web clipper: därför räcker det inte att leta mönster i HTML
Den som någon gång använt ett clipper-tillägg i webbläsaren känner igen förtreten: på den ena matbloggen plockar det ut receptet klanderfritt, på nästa kommer ingenting alls. En länk från Instagram, Facebook eller TikTok? Ingenting. Ett recept ur en tidningsartikel eller ett forumsvar? Då hoppar clippern av.
Det beror inte på slarvig programmering. Klassisk webbklippning och extraktion med AI är två i grunden olika tekniker som tar sig an samma problem från helt olika håll.
Så arbetar en klassisk web clipper
Webbläsartillägg som “Clip Recipe” och importfunktionerna i appar som Paprika plockar isär HTML. De letar igenom sidans källkod efter fasta mönster:
- Receptmärkning (JSON-LD): guldmyntfoten. Matbloggar på WordPress med ett receptinstick (till exempel WP Recipe Maker) lägger in strukturerade data där titel, ingredienser, tillagning och tid uttryckligen är utmärkta som just det.
- Microdata och RDFa: äldre format för samma ändamål.
- Mönstersökning i HTML: där inget är utmärkt gissar clippern. Den letar
<ul>-listor som skulle kunna vara ingredienser och numrerade listor som ser ut som arbetssteg.
När allt går ihop – en stor receptsajt eller en matblogg med instick och ren HTML – fungerar det utmärkt. På Recept.se eller Köket.se klipper det snabbt och exakt.
Bara det att internet inte är så städat.
Där web clippers går bet
Inlägg i sociala medier
Instagram, TikTok, Facebook och YouTube använder ingen receptmärkning. Receptet ligger i en bildtext, i en videobeskrivning eller i det någon säger i videon. Där finns ingen struktur att hålla sig i – och titta eller lyssna på en video kan en clipper ändå inte.
Vill du spara ett recept från Instagram ser förlagan ofta ut så här:
“Mormors köttbullar!! 🥔 alltså ni behöver typ 500 g blandfärs, en gul lök, 1 dl ströbröd, 1 dl mjölk, ett ägg, salt, peppar och lite kryddpeppar. Blötlägg ströbrödet i mjölken, fräs löken mjuk, blanda ihop allt och låt stå en halvtimme. Rulla och stek i rikligt med smör. Lita på mig på den här 🙏”
För en web clipper är det inget recept. Inga <li>-element för ingredienser, inget <ol> för stegen. Bara ett stycke text med emojier.
Sidor utan struktur
Också på det vanliga nätet ligger gott om recept utan strukturerade data:
- Trådar i matforum, från Kokaihop och nedåt
- Recept som skickas runt i Facebook-grupper
- Receptsidor i tidningar, från Icakuriren till Allt om Mat
- Nyhetsbrev
- Recept-PDF:er
På allt det där ger en klassisk clipper antingen ingenting eller bokstavssallad.
Problemet med förspelet
Till och med på matbloggar, där clippers fungerar bäst, finns en hake: före själva receptet står ofta tvåtusen ord semesterminnen. Clippern tar då för mycket eller för lite, och sedan letar du receptet i det klippta för hand.
Så arbetar extraktion med AI
AI:n går tillväga på ett helt annat sätt. I stället för att leta HTML-mönster läser och förstår den innehållet.
Det här händer när du klistrar in en länk i Pluck:
Steg 1: hämta och förbereda innehållet
Pluck laddar sidan och drar ut allt brukbart: brödtext, metadata, befintliga strukturerade data och plattformens egna fält – Instagram-bildtext, Facebook-inlägg, YouTube-beskrivning. Vid videoadresser laddar Pluck dessutom ner videon och tolkar bild och ljud.
Finns receptmärkning (JSON-LD) tar Pluck den. Det ger den högsta träffsäkerhetspoängen. Till skillnad från en clipper stannar Pluck däremot inte där.
Steg 2: AI:n förstår innehållet
Innehållet går in i vår AI-kedja, där multimodala modeller bearbetar text, bild och ljud som en människa skulle göra. Följande bestäms:
- Titel: vad heter rätten?
- Ingredienser: vad behövs, och hur mycket?
- Tillagning: vilka steg, i vilken ordning?
- Ramuppgifter: tillagnings- och förberedelsetid, portioner, kök, svårighetsgrad
Talspråk, förkortningar, emojier och kaotisk formatering är inget hinder, skrivet såväl som talat. AI:n vet att “ett par klyftor vitlök” hör hemma i ingredienslistan, och att “sen in i ugnen på tvåhundra en halvtimme ungefär” betyder 200 grader i 30 minuter. Vid video tittar den på bilderna och lyssnar, så att även recept som inte står skrivna någonstans kommer fram.
Steg 3: träffsäkerhetspoäng
Alla extraktioner är inte lika pålitliga. Pluck sätter ett värde och grundar det på flera faktorer:
- Strukturerade data på plats? Högre värde.
- Ingredienser och steg tydligt åtskilda? Högre värde.
- Luddigt, tvetydigt innehåll? Lägre värde.
- Video med tydligt tal och text i bild? Högre värde.
- Hetsigt klippt video med hög musik och lite sammanhang? Lägre värde.
Du ser värdet innan du sparar. Så vet du när det är värt att titta närmare och när det inte är det.
Steg 4: granska och spara
Ut kommer ett rent strukturerat recept: titel, ingredienser grupperade i avsnitt, numrerade steg, tider och mer därtill. Du rättar det som ska rättas och lägger det i din receptsamling.
Skillnaden i praktiken
Samma recept, två metoder.
En klassisk clipper på ett Instagram-inlägg:
❌ “Inget recept hittades på den här sidan”
Pluck på samma Instagram-inlägg:
✅ Titel: Mormors köttbullar
Ingredienser: 500 g blandfärs, 1 gul lök, 1 dl ströbröd, 1 dl mjölk, 1 ägg, salt, peppar, kryddpeppar
Tillagning: 1. Blötlägg ströbrödet i mjölken. 2. Fräs löken mjuk. 3. Blanda samman allt och låt stå en halvtimme. 4. Rulla bullarna. 5. Stek i rikligt med smör.
Samma innehåll, grundolika resultat.
Och foton då?
Bilder kan en web clipper över huvud taget inte hantera. Receptkort, kokbokssida, skärmdump – där står du ensam.
Plucks bildförståelse läser en bild som språkmodellen läser en text. Den känner igen ett recepts beståndsdelar i bilden, vare sig det är ett tryckt kort, en avfotograferad boksida eller handskrift, och lämnar ifrån sig samma struktur som annars.
Särskilt starkt är det för:
- Familjerecept: mormors handstil, digitaliserad och sökbar
- Kokbokssidor: favoriterna ur den tryckta boken, i telefonen
- Skärmdumpar: när adressen för länge sedan är borta men bilden finns kvar
Vart det här är på väg
Webbklippning var rätt svar på internet anno 2015: mest bloggar, mest strukturerade data, mest dator.
Recept hittar man numera någon annanstans – i sociala medier, i video, i telefonen. Tekniken måste följa med.
Felfri är AI:n inte; träffsäkerhetspoäng finns av goda skäl, och en del resultat vill efterarbetas. Men den klarar den ostädade vardag som dagens receptinnehåll lever i, och det kommer en tolk som matchar HTML-mönster aldrig att göra. Pluck tittar på ett TikTok, hämtar ett recept ur ett Facebook-Reel, lyssnar på en YouTube-anvisning, läser ett handskrivet kort och tolkar en matblogg – allt genom samma kedja.
Ju bättre modellerna blir, desto exaktare blir resultatet. Det som är svårt i dag, flerspråkiga inlägg och stökiga ljudmiljöer, blir rutin.
Målet är enkelt: var du än hittar ett recept ska du kunna lägga undan det strukturerat, sökbart och lagbart. Vägen dit går via AI:n. Vill du se receptappar bredvid varandra finns det i receptappar i jämförelse, i översikten bästa receptappen eller i genomgången receptapp med AI.
Vill du se AI:n arbeta med ett riktigt recept? Pluck finns för iOS och Android. Hämta appen på Google Play. Finns även för iOS. På vår roadmap (på engelska) står vad som är på tur.
Pluck Team
Vi är ett litet gäng hemmakockar och utvecklare som bygger receptappen vi alltid velat ha. Vi skriver om att spara recept, om extraktion med AI och om smartare matlagning.
Läs mer om ossRedo att spara ditt första recept?
Tillgänglig på iOS och Android. Ladda ner Pluck gratis idag.
Vill du vara med och forma Pluck? Föreslå en funktion - vi läser varenda förslag.