Semantics.rs
Semantics.rs/Vizuelna semantika/Computer vision
Osnove

Computer vision: šta model može da izvuče iz slike?

Sistemi mašinskog vida mogu da klasifikuju sliku, detektuju objekte, segmentiraju regione, očitaju tekst i povežu vizuelne obrasce. Konkretan Google pipeline nije javno opisan kao jedna jednostavna sekvenca koraka.

Koja je razlika između glavnih zadataka?

Tipični computer vision zadaci
ZadatakRezultatSEO primer
KlasifikacijaKategorija cele slikePatika, automobil, torta
DetekcijaObjekat i okvirViše proizvoda u kadru
SegmentacijaRegioni/pikseli objektaOdvajanje proizvoda od pozadine
OCRTekst sa slikeEtiketa ili naziv modela
Embedding/podudaranjeVizuelna sličnostSlični proizvodi ili prizori
Dijagram pet computer vision zadataka nad istom slikom patike: klasifikacija, detekcija, segmentacija, OCR i embedding, sa po jednim SEO primerom za svaki
Isti ulazni kadar prolazi kroz pet različitih zadataka — svaki daje drugačiji tip rezultata i ima drugačiju SEO posledicu.

Šta iz toga praktično sledi?

Prikaži predmet dovoljno jasno za zadatak korisnika, obezbedi koristan kontekst na stranici i ne očekuj da alt tekst „prepiše“ ono što slika ne pokazuje. Za kontrolni primer otvori praktičan vodič za vizuelnu pretragu.

Koji zadatak odgovara kojoj odluci na sajtu?

Podela na zadatke nije akademska. Svaki od njih odgovara drugoj odluci pri pripremi slika, i greška u pretpostavci vodi na pogrešnu optimizaciju.

Zadatak i odluka koju iz njega izvlačiš
ZadatakŠta iz njega sledi za tvoje slike
KlasifikacijaPredmet mora biti prepoznatljiv iz jednog kadra. Umetnički kadar koji seče proizvod otežava svrstavanje.
DetekcijaAko je u kadru više proizvoda, nijedan nije jasno glavni. Za produktnu fotografiju radi zaseban kadar po proizvodu.
SegmentacijaKontrast prema pozadini pomaže izdvajanju. Zato studijska pozadina radi bolje od zatrpanog stola.
OCRTekst sa slike može biti očitan, ali se na njega ne oslanjaj — isti tekst mora postojati i kao pravi tekst.
PodudaranjeDoslednost kadra kroz katalog pomaže poređenju više nego pojedinačno savršena fotografija.

Šta pouzdano možeš da uradiš

Arhitektura sistema nije javna, ali skup postupaka koji ne zavise od nje ipak postoji.

  1. Jedan predmet, jedan kadar za slike koje treba da se prepoznaju kao proizvod.
  2. Dovoljna rezolucija uz razumnu kompresiju. Detalj koji nije u pikselima ne može biti izvučen; datoteka koja koči učitavanje šteti na drugom mestu.
  3. Kontekst na stranici oko slike. Naslov sekcije, okolni tekst i natpis nose značenje koje sama slika ne mora da sadrži.
  4. Dosledna terminologija između alt teksta, natpisa i teksta stranice — ne mehaničko ponavljanje iste rečenice, nego isti pojmovi za istu stvar.
  5. Stabilni URL-ovi slika. Promena putanje poništava sve što je sistem o toj slici već naučio.
  6. Strukturirani podaci gde su primenljivi, sa punim ImageObject čvorom umesto golog URL-a.

Česte pogrešne pretpostavke

Pretpostavka i šta zapravo važi
PretpostavkaŠta zapravo važi
Model „čita“ alt tekst da bi razumeo slikuAlt je jedan od signala uz sam sadržaj slike i kontekst stranice, ne uputstvo modelu
Veća slika uvek daje bolji rezultatPostoji tačka posle koje dodatni pikseli ne nose novi detalj, a šteta po brzinu je stvarna
Vodeni žig ne smetaPreko predmeta može da oteža segmentaciju i prepoznavanje
Dovoljno je imenovati fajl opisnoGoogle ga opisuje kao vrlo blag signal; kontekst stranice nosi više
Ograničenje: ne tvrdimo da jedan identičan pipeline stoji iza svih delova Google Images, Lens ili AI funkcija. Google potvrđuje kombinovanje alt teksta, sadržaja i computer vision algoritama, ali ne objavljuje potpunu arhitekturu sistema.

Šta se nalazi u samoj datoteci

Slika nosi i podatke koji nisu piksel: EXIF, IPTC i XMP. Google navodi da čita IPTC polja o autorskim pravima i licenci, a ta polja se prikazuju korisniku u Google Images.

Metapodaci u datoteci i njihova uloga
StandardTipičan sadržajSEO značaj
EXIFUređaj, ekspozicija, datum, ponekad GPSMali; GPS koordinate obavezno ukloni pre objave
IPTCAutor, nosilac prava, opis, uslovi korišćenjaGoogle ih čita i prikazuje u panelu slike
XMPProšireni opisi, istorija obradeKoristan za interno upravljanje sadržajem

Dve praktične posledice. Prvo, GPS koordinate iz fotografija snimljenih telefonom odaju lokaciju i treba ih ukloniti — osim ako lokacija namerno nije deo informacije. Drugo, alati za kompresiju često brišu sve metapodatke zajedno, uključujući i polja o licenci koja želiš da zadržiš. Proveri šta tvoj alat radi.

Odnos prema strukturiranim podacima: IPTC polja i ImageObject u JSON-LD-u nisu zamena jedno za drugo. Podaci u datoteci putuju sa slikom kada je neko preuzme; strukturirani podaci opisuju sliku u kontekstu stranice. Za podobnost za oznaku licenciranja Google traži strukturirane podatke ili IPTC, ali dosledno je imati oba.

Video i pokretni sadržaj

Za video sistem ne analizira samo sličice nego i transkript, poglavlja i strukturirane podatke. Najveći deo onoga što pretraživač razume o videu dolazi iz teksta koji ide uz njega, ne iz same slike.

Šta priložiti uz video
ElementZašto
Transkript na straniciJedini deo sadržaja koji je u potpunosti čitljiv i pretraživ
Titlovi kao poseban fajlPristupačnost i razumevanje sadržaja, nezavisno od transkripta
VideoObject markupthumbnailUrl, uploadDate, duration, contentUrl
Poglavlja sa vremenskim oznakamaPodobnost za prikaz ključnih trenutaka
Namenska sličicaPrvi kadar je retko najinformativniji kadar

Isto načelo važi i za animirani sadržaj i za dijagrame koji se generišu skriptom: ako informacija postoji samo u pokretu ili tek posle izvršavanja skripte, za deo sistema ona ne postoji.

Kako se meri da li slike uopšte rade

U Search Console-u postoji zaseban tip pretrage za slike. Bez razdvajanja tog izveštaja od veb pretrage, ne znaš da li slike donose bilo šta.

  1. Razdvoji tip pretrage. U izveštaju o učinku promeni tip sa „Veb“ na „Slika“ i uporedi prikaze i klikove.
  2. Pogledaj koje stranice dobijaju te klikove. Često nisu one na kojima si najviše radio.
  3. Proveri indeksiranost slika kroz sitemap za slike i izveštaje o pokrivenosti.
  4. Meri po grupi, ne po pojedinačnoj slici. Jedna slika retko daje signal iz kojeg se nešto zaključuje.
  5. Beleži datum svake veće izmene u obradi slika, inače kasnije ne možeš da pripišeš promenu.

Ograničenje merenja: Search Console ne izveštava odvojeno o Google Lens-u ni o tome koliko puta je slika korišćena u generisanom odgovoru. Prikazi u AI funkcijama pretrage postoje kao zaseban izveštaj, ali se ne razlažu po slici. Zaključci o vizuelnoj pretrazi zato ostaju posredni.

Tehnička priprema koja utiče na obradu

Odluke pri izvozu slika
OdlukaPreporukaRazlog
FormatWebP ili AVIF, uz JPEG samo gde je nužnoManja datoteka pri istom kvalitetu
DimenzijeViše veličina preko srcsetTelefon ne treba da preuzima sliku za monitor
Atributi width i heightUvek navedeniSprečavaju pomeranje rasporeda pri učitavanju
loadinglazy za sve osim prve vidljive slikeOdlaganje glavne slike pogoršava učitavanje
Naziv datotekeOpisan, bez dijakritike i razmakaBlag signal, ali besplatan
PutanjaStabilna, bez heša koji se menja pri svakoj izmeniPromena putanje poništava istoriju slike

Poslednji red je najčešće previđen na sajtovima koji koriste alate za pakovanje. Ako se ime datoteke menja pri svakom objavljivanju, svaka slika je za pretraživač nova slika bez istorije.

Granica onoga što se može tvrditi

Ova stranica opisuje tipove zadataka i postupke koji iz njih slede. Ne opisuje kako Google interno kombinuje te zadatke, jer to nije javno.

Šta je dokumentovano, a šta izvedeno
TvrdnjaStatus
Google kombinuje alt tekst, sadržaj stranice i algoritme mašinskog vidaPotvrđeno u dokumentaciji
Google čita IPTC polja o pravima i licenciPotvrđeno u dokumentaciji
Naziv datoteke je vrlo blag signalNavedeno od strane Google-a
Studijska pozadina olakšava izdvajanje predmetaIzvedeno iz prirode zadatka segmentacije, nije Google tvrdnja
Doslednost kadra kroz katalog pomaže podudaranjuNaša radna pretpostavka, nije merena

Česta pitanja

Da li Google koristi jedan isti pipeline za sve slike?

Google potvrđuje da kombinuje alt tekst, sadržaj stranice i algoritme mašinskog vida, ali ne objavljuje potpunu arhitekturu niti jedinstven redosled koraka.

Da li studijska pozadina uvek daje bolji rezultat?

Za produktne fotografije kontrast prema pozadini olakšava izdvajanje predmeta. Za sadržaj gde je kontekst deo informacije, prirodan kadar može biti prikladniji.

Da li vodeni žig šteti?

Preko samog predmeta može da oteža segmentaciju i prepoznavanje. Diskretan žig van predmeta je manji problem.