Software I: Modelul de procesare a datelor

Model de procesare a datelor NDVI.

Berlin, Germany15 decembrie 2025 – 31 octombrie 2026

Prima colectare de date

Sezonul 2025: cum au fost pregătite datele de intrare, ce model a fost ales și cum a fost antrenat.

Analiza infrastructurii datelor de intrare

Prezentare generală

Acest raport prezintă un cadru metodologic pentru procesarea datelor multispectrale de dronă de pe parcele de grâu și estimarea necesarului de azot și apă cu ajutorul învățării automate și al unei evaluări bazate pe LLM.

Pregătirea și definirea datelor

Setul de date combină statisticile XML obținute din imagini multispectrale de dronă cu variabilele de azot și irigare ale parcelelor.

  • Clase de azot: 0 g/m² (scăzut), 10 g/m² (mediu), 20 g/m² (ideal).
  • Clase de irigare: 0% (scăzut), 50% (mediu), 100% (ideal).
  • Concluzie preliminară din corelații: azotul are o legătură mai puternică cu NDVI decât irigarea.

Metodologie și procesarea datelor

  • Transformarea datelor din format lat (coloane pe date) în format lung (un rând pentru fiecare moment de măsurare).
  • Adăugarea DAS (zile de la semănat) pentru a modela efectul vârstei biologice asupra evoluției NDVI.
  • Normalizarea caracteristicilor cu StandardScaler; codificarea valorilor categoriale cu LabelEncoder.
  • Adăugarea amplitudinii de eterogenitate (Max–Min) ca o caracteristică ce surprinde variabilitatea din parcelă, relevantă pentru stresul hidric.

Selecția modelului

Învățare automată versus modele lingvistice mari

  • ML: cost de calcul redus, fiabilitate deterministă, necesită expertiză în domeniu pentru construirea caracteristicilor (DAS, scalare).
  • LLM: cost ridicat de calcul/API, poate surprinde relații logice, dar există riscul de halucinații.
  • Configurare few-shot: se furnizează 215 exemple reale de antrenare și se cer 55 de predicții de test.

Rezultatele analizei

Predicția azotului

Puncte principale

Gemini 3 (LLM) a atins o acuratețe de 72,73%; dintre modelele ML, Naive Bayes a condus cu 65,50%.

Predicția stresului hidric (irigare)

Puncte principale

Gemini 3 și DeepSeek-V3 au atins 54,55%; dintre modelele ML, arborele de decizie a condus cu 49,10%.

Comparație completă

Tabelul de rezultate inclus conține toate modelele evaluate și acuratețea lor.

Evaluare generală și foaie de parcurs

  • Concluzia principală: procesarea bazată pe expertiză (mai ales DAS) este esențială.
  • Decizie: Naive Bayes pentru azot (eficient ca cost și stabil între modelele ML).
  • Decizie: arbore de decizie pentru stresul hidric, pentru a surprinde ramificațiile neliniare.

Antrenarea modelului

Prezentare generală

Acest raport descrie metodologia de antrenare, criteriile de selecție și procesele de operare pentru modelele de clasificare antrenate pe date agricole procesate (DAS, statistici spectrale, ID-urile parcelelor).

Strategia și metodologia de antrenare

  • Împărțire pe grupuri (GroupShuffleSplit): gruparea după ID-ul parcelei, pentru a evita memorarea atunci când aceeași parcelă apare la date diferite.
  • Alegerea algoritmului pune accent pe potrivirea cu date puține și pe logica agronomică, mai mult decât pe acuratețea matematică pură.
  • Standardizare și etichetare: intrările se normalizează cu StandardScaler, țintele se codifică prin Label Encoding.

Ideea principală

Capacitatea de generalizare se evaluează pe parcele pe care modelul nu le-a văzut niciodată, evitând ca același ID de parcelă să apară și la antrenare, și la test.

Modelele alese și motivarea

Predicția azotului

Gaussian Naive Bayes – acuratețe 65,5%

Ales pentru stabilitatea cu puține observații și pentru corelația puternică dintre NDVI/indicii spectrali și azot, ceea ce reduce riscul de supraînvățare.

Predicția irigării

Arbore de decizie – acuratețe 49,1%

Ales pentru a surprinde efectele neliniare, determinate de praguri, ale irigării asupra morfologiei plantelor.

Gestionarea modelelor

  • Persistența obiectelor: modelele antrenate, scalerele și codificatoarele de etichete se salvează ca .pkl, pentru reutilizare fără reantrenare.
  • Fluxul de inferență: primește date XML brute și datele zborurilor și aplică aceiași pași de scalare/codificare ca la antrenare.

Evaluare generală și limite

Principala limită este volumul redus al setului de date; acuratețea pentru irigare este limitată de diversitatea insuficientă pentru generalizare.

Concluzie

Infrastructura este validată logic; pe măsură ce volumul de date crește, se așteaptă o acuratețe mai mare prin reantrenare, fără modificări structurale ale codului.

A doua colectare de date

Actualizarea modelelor și analiza acurateței după a doua colectare de date

A doua colectare de date

A doua colectare de date acoperă sezonul de grâu 2026 pe același câmp experimental cu 54 de parcele din Adana, condus de Universitatea Çukurova. Designul experimentului este identic cu primul sezon: trei niveluri de azot (0, 10 și 20 g/m²) și trei niveluri de irigare (0%, 50% și 100%), fiecare dintre cele nouă combinații aplicată pe șase parcele, în două blocuri de semănat (semănat timpuriu la 26 decembrie 2025, semănat târziu la 9 martie 2026).

Câmpul a fost survolat de șapte ori între 24 februarie și 30 iunie 2026 cu o dronă multispectrală DJI Mavic 3M la 50 m altitudine. Imaginile au fost procesate în hărți NDVI și livrate ca statistici zonale pe parcelă, câte un tabel pentru fiecare zbor.

Harta celor 54 de parcele, fiecare etichetată cu tratamentul ei, de exemplu N20_IRG100_E: 20 g/m² azot, 100% irigare, semănat timpuriu.
Designul experimentului din arhiva de date a Universității Çukurova: fiecare parcelă etichetată cu nivelul de azot (N0, N10, N20), nivelul de irigare (IRG0, IRG50, IRG100) și blocul (E timpuriu, L târziu). Irigarea se întinde în benzi de-a lungul fiecărui bloc; azotul variază în interiorul fiecărei benzi.
  • Sezonul 2025: 5 zboruri (15 aprilie – 16 iunie 2025), 270 de măsurători pe parcele.
  • Sezonul 2026: 7 zboruri (24 februarie – 30 iunie 2026), 324 de măsurători pe parcele.
  • Total: 594 de măsurători pe 54 de parcele, în două sezoane.

Cum am lucrat

Cele două sezoane au fost pregătite ca un singur set de date coerent, s-a ales cel mai bun model pentru azot și pentru irigare, iar rezultatul a fost analizat. Toți pașii sunt notebook-uri Python reproductibile; fiecare număr este calculat din date.

  • Aceeași metodă de măsurare pentru ambele sezoane: s-au folosit doar statisticile disponibile în ambii ani (media, maximul, minimul, abaterea standard și amplitudinea NDVI pe parcelă, plus zilele de la semănat).
  • Verificarea etichetelor: în tabelul de etichete din 2026, 10 parcele din blocul târziu contraziceau codul parcelei; s-a folosit codul parcelei, deoarece corespunde designului din 2025 și hărții câmpului.
  • Măsurători nevalide eliminate: două zboruri din 2026 au avut loc înainte de semănatul blocului târziu, deci acele 54 de măsurători arătau sol gol, nu grâu.
  • Aceeași utilizare ca în câmp: modelul prezice nivelurile unei parcele dintr-un singur zbor plus zilele de la semănat, exact cum îl folosește software-ul.
  • Testare corectă: toate măsurătorile unei parcele rămân împreună fie la antrenare, fie la test; 5 grupuri de parcele, repetate de 3 ori, dau 15 runde de test. Ghicitul la întâmplare obține 33%.

Modele testate și alese

Au fost testate douăsprezece modele de clasificare din toate familiile uzuale: regresie logistică, Ridge, k-cei mai apropiați vecini, Naive Bayes, mașini cu vectori suport, arbore de decizie, Random Forest, Extra Trees, AdaBoost, Gradient Boosting, XGBoost și CatBoost. Toate s-au situat într-un interval îngust: 42–51% pentru azot și 27–36% pentru irigare. Diferența dintre cel mai bun și cel mai slab (circa 9 puncte) este aceeași cu variația normală dintre rundele de test (circa ±6 puncte), deci alegerea algoritmului contează puțin.

Azot: XGBoost

acuratețe 51% · șansă 33% · p = 0,01

Identifică în mod fiabil parcelele care nu au primit îngrășământ, dar confundă adesea nivelurile de 10 și 20 g/m². Un test de permutare confirmă că semnalul de azot este real.

Irigare: Extra Trees

acuratețe 36% · p = 0,14

Cel mai bun scor dintre candidați, dar statistic imposibil de deosebit de șansă. Este inclus în software pentru completitudine; rezultatul lui nu trebuie folosit pentru decizii de irigare.

De ce s-au schimbat modelele față de Colectarea datelor 1

Prima fază a ales Naive Bayes (azot) și un arbore de decizie (irigare) pe baza unei singure împărțiri de test cu 11 parcele. Măsurat pe 15 runde, Naive Bayes a atins 42% pentru azot, printre cele mai slabe dintre cele 12 modele. Modelele din prima fază foloseau și mediana NDVI, pe care tabelele din 2026 nu o conțin, deci o nouă selecție era oricum necesară.

De ce nu a crescut acuratețea

Primul raport indica 65,5% pentru azot și 49,1% pentru irigare, dintr-o singură împărțire de test. Repetată pe 200 de împărțiri aleatorii, aceeași procedură a dat în medie 44% pentru azot, iar modelele din prima fază, aplicate neschimbate pe datele din 2026, au atins 47% și 36%. Noile cifre nu sunt un regres, ci o măsurare mai fiabilă a aceleiași limite, care ține de ce poate arăta NDVI în acest experiment.

Grafic cu bare: NDVI mediu 0,38 la 0 g/m², 0,56 la 10 g/m², 0,51 la 20 g/m² azot.
Figura 1. NDVI mediu pe niveluri de azot (toate cele 594 de măsurători, ambele sezoane).

Doza pe jumătate a crescut clar NDVI (de la 0,38 la 0,56); doza întreagă nu l-a crescut mai mult (0,51). Parcelele nefertilizate pot fi deosebite (80% într-un test cu două clase, față de 67% dacă ghicești mereu „fertilizat”), dar doza pe jumătate și cea întreagă nu (49%, ca aruncarea unei monede). Plafonul practic pentru azot este deci de aproximativ 67%, iar modelul ales parcurge cam jumătate din distanța de la șansă până la acest plafon.

Grafic cu bare: NDVI mediu este aproape același la 0%, 50% și 100% irigare.
Figura 2. NDVI mediu pe niveluri de irigare (toate cele 594 de măsurători, ambele sezoane).

Cele trei niveluri de irigare au aproape același NDVI mediu, iar parcelele neirigate au fost chiar puțin mai verzi (0,51) decât cele irigate complet (0,47). Fiecare nivel de irigare ocupă o fâșie continuă a câmpului, deci nivelul de irigare și poziția în câmp sunt aceeași variabilă (Spearman ρ = 0,94; pentru azot ρ = 0,01): niciun model nu poate deosebi apa de poziție.

Grafic: în câte dintre cele 22 de grupuri de zboruri este valabilă fiecare comparație NDVI.
Figura 3. Numărul de grupuri de zboruri în care este valabilă fiecare comparație (12 zboruri × 2 blocuri de semănat = 22 de grupuri).

Verificat zbor cu zbor, doza pe jumătate a fost mai verde decât lipsa îngrășământului în 18 din 22 de grupuri, deci efectul azotului este consecvent. Doza întreagă a fost mai verde decât cea pe jumătate doar în 4 din 22, iar parcelele irigate complet au fost mai verzi decât cele neirigate doar în 5 din 22.

Vremea: plouase deja suficient?

Vremea zilnică pentru câmp (reanaliza ERA5, arhiva Open-Meteo) a fost comparată cu necesarul de apă al culturii (evapotranspirația de referință, ET₀). Datele și cantitățile de irigare nu au fost disponibile, deci s-au folosit doar date meteo.

Grafic cu bare: precipitații 2025 de 507 mm față de un necesar de 580 mm; 2026 de 878 mm față de 620 mm.
Figura 4. Precipitațiile totale și necesarul de apă al culturii (ET₀), de la semănatul timpuriu până la ultimul zbor al fiecărui sezon.
  • 2025: 507 mm de ploaie față de un necesar de 580 mm; ploaia a acoperit aproximativ 87% din necesar.
  • 2026: 878 mm de ploaie față de 620 mm; ploaia a depășit necesarul cu 257 mm, deci chiar și parcelele niciodată irigate au primit mai multă apă decât era nevoie.
Grafic: precipitațiile din cele 14 zile dinaintea fiecăruia dintre cele 12 zboruri cu drona.
Figura 5. Precipitațiile din cele 14 zile dinaintea fiecărui zbor cu drona.

8 din cele 12 zboruri au urmat după peste 25 mm de ploaie în cele două săptămâni anterioare (în medie 55 mm), deci majoritatea măsurătorilor au fost făcute când întregul câmp fusese recent umezit, indiferent de nivelul de irigare.

Evaluare generală

  • Azot: NDVI-ul din imaginile de dronă conține un semnal de azot real și repetabil. Modelul detectează fiabil parcelele nefertilizate, dar nu poate separa doza pe jumătate de cea întreagă. Cei 51% ai săi sunt mult peste șansă (33%) și cam la jumătatea drumului spre plafonul practic (circa 67%).
  • Irigare: datele nu conțin un semnal de irigare utilizabil. Nivelurile de irigare coincid cu poziția în câmp, iar ploaia a acoperit cea mai mare parte a necesarului de apă în ambele sezoane. Aceasta este o limită a designului experimentului și a vremii, nu a modelului.
  • Mai multe date de același tip sau alt algoritm este puțin probabil să ajute: toate cele 12 modele au rezultate asemănătoare, iar creșterea setului de antrenare de la 24 la 43 de parcele a îmbunătățit acuratețea pentru azot cu doar 2,7 puncte.

Îmbunătățiri posibile

Exprimarea NDVI-ului fiecărei parcele în raport cu celelalte parcele ale aceluiași zbor a crescut în teste acuratețea pentru azot de la 49% la 56%; metoda nu face parte din modelul livrat. Pentru experimentele viitoare: distribuirea nivelurilor de irigare în câmp în loc de fâșii, înregistrarea datelor și cantităților de irigare, măsurarea umidității solului și testarea unor benzi spectrale dincolo de NDVI, precum red edge.